{"id":"W7106801756","doi":"10.48448/0m3d-a714","title":"LingGym: How Far Are LLMs from Thinking Like Field Linguists?","year":2025,"lang":"","type":"other","venue":"Open MIND","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Inference; Morpheme; Context (archaeology); Theoretical linguistics; Linguistic description; Field (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01199268,0.001343944,0.0007549663,0.002181164,0.001324447,0.006274289,0.002980761,0.002851444,0.01409002],"category_scores_gemma":[0.04906742,0.0006022057,0.0008194061,0.001580945,0.002828124,0.017046,0.004985379,0.003793158,0.007162392],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001880569,"about_ca_system_score_gemma":0.003221959,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006547982,"about_ca_topic_score_gemma":0.007938749,"domain_scores_codex":[0.9936474,0.003404957,0.0002818733,0.001233365,0.001124029,0.0003083721],"domain_scores_gemma":[0.9707643,0.01520142,0.0009352714,0.009335775,0.002183325,0.001579885],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001774384,0.0007142113,0.06017361,0.001661419,0.0004032005,0.0004397473,0.009723511,0.02150803,0.009245857,0.08274511,0.1214945,0.6901163],"study_design_scores_gemma":[0.0004463202,0.0008434879,0.02376044,0.001192288,0.0001826756,0.0007539282,0.01016342,0.2086878,0.02046886,0.4579639,0.2752624,0.0002744268],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.4742025,0.006542944,0.2654444,0.02576657,0.001243416,0.0005118959,0.01275932,0.06497487,0.148554],"genre_scores_gemma":[0.8178234,0.001073412,0.1472346,0.003406937,0.0001893783,0.0002732712,0.01543599,0.003905771,0.0106573],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01409002,"threshold_uncertainty_score":0.06342411,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03579657533787377,"score_gpt":0.3106712507854574,"score_spread":0.2748746754475836,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}