{"id":"W4416035125","doi":"10.18653/v1/2025.emnlp-main.1803","title":"Which Word Orders Facilitate Length Generalization in LMs? An Investigation with GCG-Based Artificial Languages","year":2025,"lang":"","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Generalization; Word (group theory); Natural language; Feature (linguistics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004290552,0.0004226196,0.0003290134,0.0006485565,0.0004174548,0.001780264,0.0009233896,0.0007644384,0.003382409],"category_scores_gemma":[0.04049585,0.0003221458,0.0004707495,0.0006244765,0.002046251,0.005189122,0.001765114,0.001584499,0.0005022237],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008310102,"about_ca_system_score_gemma":0.0005003933,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008243179,"about_ca_topic_score_gemma":0.0009943348,"domain_scores_codex":[0.9968309,0.001875205,0.0001724969,0.0005957439,0.0004036392,0.0001219836],"domain_scores_gemma":[0.9644658,0.02547647,0.002071224,0.006084613,0.0014343,0.0004675873],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001265988,0.0005986877,0.1075341,0.001367918,0.0002223454,0.00119199,0.02177092,0.05758032,0.1340464,0.3463844,0.006037764,0.3219992],"study_design_scores_gemma":[0.0001563749,0.0007478605,0.03601963,0.0001591713,0.0001743746,0.0009252066,0.006192058,0.3399245,0.06710456,0.5302911,0.0181352,0.0001699112],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8951005,0.000194105,0.0934888,0.001045174,0.0000470121,0.00008384698,0.0003457374,0.0008816783,0.008812995],"genre_scores_gemma":[0.9766707,0.00007053934,0.0223103,0.0001399113,0.00001637946,0.00005541783,0.000174203,0.0001196504,0.0004429046],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.004290552,"threshold_uncertainty_score":0.02269089,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02043552982018987,"score_gpt":0.2847153190315617,"score_spread":0.2642797892113718,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}