{"id":"W4389524117","doi":"10.18653/v1/2023.conll-babylm.18","title":"McGill BabyLM Shared Task Submission: The Effects of Data Formatting and Structural Biases","year":2023,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Canadian Institute for Advanced Research; McGill University; Mila - Quebec Artificial Intelligence Institute","funders":"Natural Sciences and Engineering Research Council of Canada; McGill University; Nvidia","keywords":"Disk formatting; Computer science; Task (project management); Track (disk drive); Operating system; Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02594391,0.00364847,0.002189412,0.001013738,0.00272774,0.004242083,0.00462238,0.002835024,0.01982216],"category_scores_gemma":[0.08241896,0.001377351,0.001421385,0.001822636,0.001208517,0.003928507,0.006272737,0.005222174,0.01507249],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002726643,"about_ca_system_score_gemma":0.004207679,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0253084,"about_ca_topic_score_gemma":0.05719407,"domain_scores_codex":[0.9790395,0.01027606,0.001350334,0.003797678,0.004005491,0.0015309],"domain_scores_gemma":[0.9498689,0.0234188,0.001284337,0.01266152,0.0092529,0.003513697],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.006744273,0.001047411,0.01220435,0.001568054,0.0007334952,0.0009146836,0.0009654789,0.03662516,0.02400994,0.002644146,0.7297263,0.1828166],"study_design_scores_gemma":[0.004679872,0.004716867,0.04042881,0.0005608105,0.0005904994,0.002020924,0.001893521,0.4736646,0.08103047,0.02026311,0.369117,0.001033624],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4647624,0.004072659,0.1617449,0.009592332,0.01942535,0.003351488,0.1022288,0.1775444,0.05727761],"genre_scores_gemma":[0.5722027,0.000418269,0.1485661,0.004097337,0.001205746,0.003304916,0.2042405,0.02866347,0.03730097],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02594391,"threshold_uncertainty_score":0.1372062,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07711472960388542,"score_gpt":0.3033177463314425,"score_spread":0.2262030167275571,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}