{"id":"W4389524428","doi":"10.18653/v1/2023.nlposs-1.25","title":"The Vault: A Comprehensive Multilingual Dataset for Advancing Code Understanding and Generation","year":2023,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute; McGill University","funders":"","keywords":"Open source software; Computer science; Code (set theory); Open source; Vault (architecture); Ho chi minh; Natural language processing; Artificial intelligence; Software; Programming language; History; Cartography; Geography; Archaeology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002484832,0.002384897,0.00108934,0.007521892,0.002103715,0.002670268,0.003553394,0.003416099,0.006817224],"category_scores_gemma":[0.01048721,0.0008836283,0.001728714,0.005020104,0.001048679,0.004317602,0.005896103,0.002768018,0.01510586],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001538219,"about_ca_system_score_gemma":0.00383472,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02249315,"about_ca_topic_score_gemma":0.0485975,"domain_scores_codex":[0.9960001,0.0008014078,0.0005536619,0.001042963,0.001275872,0.000325946],"domain_scores_gemma":[0.9936799,0.001446451,0.0005701106,0.002027138,0.001620029,0.0006563298],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0005904198,0.0002818437,0.009377114,0.002112418,0.0002187399,0.000499981,0.0006603181,0.004089077,0.006994138,0.005770979,0.9044079,0.06499705],"study_design_scores_gemma":[0.0005736642,0.0002012872,0.01637899,0.0005994245,0.0001539967,0.0005930568,0.0008295327,0.02769895,0.01328694,0.01188801,0.9275185,0.0002776637],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.01906379,0.002156501,0.02338144,0.0009705604,0.0004549133,0.0003693143,0.9076862,0.03740224,0.008515033],"genre_scores_gemma":[0.008866183,0.0002361948,0.01843015,0.0001442374,0.0000333262,0.0003174604,0.969349,0.001340408,0.001282961],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.02249315,"threshold_uncertainty_score":0.04472446,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09684993925383269,"score_gpt":0.3615021865434158,"score_spread":0.2646522472895831,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}