{"id":"W4412888761","doi":"10.18653/v1/2025.findings-acl.111","title":"Drop Dropout on Single Epoch Language Model Pretraining","year":2025,"lang":"en","type":"article","venue":"","topic":"Speech and dialogue systems","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Canadian Institute for Advanced Research","keywords":"Dropout (neural networks); Drop out; Computer science; Drop (telecommunication); Language model; Artificial intelligence; Machine learning; Economics; Telecommunications","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0001644323,0.00009164215,0.0001116769,0.0001150151,0.00005606302,0.0001334941,0.0004694522,0.00005283526,0.00001551945],"category_scores_gemma":[0.00006544244,0.00007654937,0.00004638224,0.0002782421,0.00001602309,0.0001428353,0.0001108045,0.00007599412,0.0001288876],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0000627311,"about_ca_system_score_gemma":0.00007484166,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00009447148,"about_ca_topic_score_gemma":0.00002217583,"domain_scores_codex":[0.9991677,0.00002786291,0.0001396673,0.000279627,0.0001652104,0.0002198997],"domain_scores_gemma":[0.9993413,0.0000587849,0.00002701621,0.0004904799,0.00002731515,0.00005508898],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000129159,0.0001660557,0.0002693398,0.00003105131,0.00002649784,0.00003837251,0.002865287,0.0007957817,0.0354243,0.8954955,0.01384402,0.05103084],"study_design_scores_gemma":[0.0003197794,0.00008300444,0.00004452789,0.00005266445,0.000002510582,0.000003544633,0.0002385011,0.955516,0.03384534,0.009449231,0.0002904048,0.0001544873],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01901766,0.00004307249,0.532953,0.000329591,0.0003235372,0.00007753401,8.122334e-7,0.0002382935,0.4470164],"genre_scores_gemma":[0.9644282,3.274275e-7,0.0234493,0.001087159,0.00004164571,0.000006735699,0.000001663929,0.000004292198,0.01098062],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9547202,"threshold_uncertainty_score":0.3121592,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01653676269129877,"score_gpt":0.2648106750246286,"score_spread":0.2482739123333298,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}