{"id":"W4406419660","doi":"10.1136/bjo-2024-326254","title":"Can large language models fully automate or partially assist paper selection in systematic reviews?","year":2025,"lang":"en","type":"article","venue":"British Journal of Ophthalmology","topic":"Meta-analysis and systematic reviews","field":"Decision Sciences","cited_by":21,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University","funders":"National Key Research and Development Program of China; National Natural Science Foundation of China","keywords":"Selection (genetic algorithm); Medicine; Systematic review; Data science; Natural language processing; MEDLINE; Artificial intelligence; Computer science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.1051594,0.0002600102,0.005614078,0.0006792609,0.0001329463,0.0006782151,0.001393007,0.0001713283,0.007386366],"category_scores_gemma":[0.04241652,0.0001495298,0.001371505,0.001817577,0.00004200262,0.0004375775,0.000105563,0.0003832934,0.0001957267],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001171212,"about_ca_system_score_gemma":0.0002857294,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00008464838,"about_ca_topic_score_gemma":0.0004952258,"domain_scores_codex":[0.9657714,0.01878043,0.01277179,0.0005150089,0.001768049,0.0003933798],"domain_scores_gemma":[0.9890591,0.002416751,0.006571672,0.0007745093,0.001039616,0.0001383847],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"case_report","study_design_scores_codex":[0.0008109477,0.004982937,0.1754072,0.07158952,0.007237114,0.137028,0.007752526,0.009361041,0.003148761,0.02650649,0.4881346,0.06804092],"study_design_scores_gemma":[0.005777569,0.001152015,0.1845625,0.0518871,0.00334665,0.6051874,0.005981635,0.06363411,0.00009335753,0.06157548,0.01505326,0.00174895],"study_design_candidate":"case_report","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9119396,0.04736707,0.01609155,0.0019157,0.001518824,0.00303841,0.00003987914,0.00001218972,0.0180768],"genre_scores_gemma":[0.9802906,0.0002089574,0.001783398,0.0003670751,0.0000750551,0.00006062938,0.000001801625,0.00001188812,0.0172006],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4730813,"threshold_uncertainty_score":0.993521,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3990391644726624,"score_gpt":0.4887466810535566,"score_spread":0.08970751658089415,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}