{"id":"W7117408127","doi":"10.1016/j.imed.2025.11.003","title":"From radiology findings to artificial intelligence-powered impressions: A retrospective study on the comparative performance of recent large language models","year":2025,"lang":"en","type":"article","venue":"Intelligent Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hamilton Health Sciences; Juravinski Hospital; Population Health Research Institute; McMaster University","funders":"","keywords":"Ranking (information retrieval); Metric (unit); Test (biology); Retrospective cohort study","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01479819,0.0008795912,0.000550541,0.00209451,0.0003024772,0.002349983,0.001286112,0.0006706559,0.001142085],"category_scores_gemma":[0.08407164,0.0004039992,0.001292815,0.001317478,0.0007951773,0.001743082,0.001596826,0.00115373,0.001213298],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009624206,"about_ca_system_score_gemma":0.0007341169,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002565179,"about_ca_topic_score_gemma":0.002796418,"domain_scores_codex":[0.9891544,0.005473483,0.001031048,0.001657346,0.002451223,0.0002324141],"domain_scores_gemma":[0.9452004,0.03177231,0.006171544,0.008881486,0.006860558,0.001113738],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"observational","study_design_scores_codex":[0.003307272,0.000568698,0.4531139,0.002397477,0.001287177,0.0008183372,0.00381114,0.02003467,0.006215787,0.001071141,0.02885999,0.4785145],"study_design_scores_gemma":[0.0005854655,0.006084715,0.6260974,0.001634496,0.002558963,0.006721805,0.005963308,0.2174944,0.0403491,0.00594637,0.08581115,0.0007528334],"study_design_candidate":"observational","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9283298,0.008907656,0.03414207,0.001410924,0.000346501,0.0005508515,0.017303,0.003546152,0.005463005],"genre_scores_gemma":[0.9531087,0.001423894,0.02315383,0.0003453672,0.0001866432,0.0001832828,0.02045921,0.0003258192,0.0008131273],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01479819,"threshold_uncertainty_score":0.07826126,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2278049659794537,"score_gpt":0.4691366938755107,"score_spread":0.2413317278960571,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}