{"id":"W4409963278","doi":"10.1098/rsos.241776","title":"Generalization bias in large language model summarization of scientific research","year":2025,"lang":"en","type":"article","venue":"Royal Society Open Science","topic":"Topic Modeling","field":"Computer Science","cited_by":84,"is_retracted":false,"has_abstract":true,"ca_institutions":"Western University","funders":"","keywords":"Automatic summarization; Generalization; Computer science; Natural language processing; Artificial intelligence; Language model; Epistemology; Philosophy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.07901096,0.001205113,0.001267829,0.002885903,0.0008380185,0.003875492,0.001884103,0.001654813,0.001964866],"category_scores_gemma":[0.304273,0.000619041,0.001354153,0.001918689,0.001212531,0.005964571,0.003116737,0.002653822,0.0008025205],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001890247,"about_ca_system_score_gemma":0.002310293,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004497176,"about_ca_topic_score_gemma":0.007212297,"domain_scores_codex":[0.9282089,0.05912928,0.003777046,0.004743576,0.003685988,0.0004551533],"domain_scores_gemma":[0.5770692,0.379665,0.01825031,0.01619946,0.007716185,0.001099866],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003918729,0.0005375172,0.1215578,0.007417943,0.003313603,0.00120013,0.0229698,0.1739214,0.01541438,0.0275752,0.04290343,0.5792699],"study_design_scores_gemma":[0.0005347849,0.001072611,0.03021749,0.001403192,0.0009868818,0.0005581825,0.003759373,0.8078074,0.01535241,0.1078027,0.03006157,0.0004434182],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.480582,0.007013469,0.4724196,0.01094203,0.0008226167,0.001177445,0.005333244,0.01394265,0.00776698],"genre_scores_gemma":[0.8889725,0.0007092417,0.1010436,0.001915714,0.0002840187,0.000657053,0.004500854,0.000658272,0.001258715],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.920989,"threshold_uncertainty_score":0.4178548,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09027618539005793,"score_gpt":0.3897188774648272,"score_spread":0.2994426920747693,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}