{"id":"W7117408127","doi":"10.1016/j.imed.2025.11.003","title":"From radiology findings to artificial intelligence-powered impressions: A retrospective study on the comparative performance of recent large language models","year":2025,"lang":"en","type":"article","venue":"Intelligent Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Hamilton Health Sciences; Juravinski Hospital; Population Health Research Institute; McMaster University","funders":"","keywords":"Ranking (information retrieval); Metric (unit); Test (biology); Retrospective cohort study","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001131814,0.000292076,0.0007896841,0.0004323026,0.0002212994,0.00001146024,0.0003448054,0.0001463617,0.001322642],"category_scores_gemma":[0.001274916,0.0001820594,0.00008740757,0.001075111,0.0002381026,0.00006217109,0.00009715684,0.0005885749,0.0001215756],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003364373,"about_ca_system_score_gemma":0.0002226029,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001196164,"about_ca_topic_score_gemma":0.0001895499,"domain_scores_codex":[0.9970758,0.0002417385,0.001174428,0.0005666657,0.0005097563,0.0004315885],"domain_scores_gemma":[0.9974094,0.0008787311,0.0001905825,0.000756762,0.0005795076,0.0001849918],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.01060796,0.006805842,0.05395041,0.0001800794,0.00125478,0.00005629655,0.6959633,0.0009671041,0.02662637,0.03704454,0.02246618,0.1440772],"study_design_scores_gemma":[0.0002591619,0.01075045,0.01770477,0.002442291,0.0004171225,0.000009700557,0.5204818,0.01380085,0.4082715,0.02356829,0.001857453,0.0004365816],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9709421,0.0005140388,0.007157937,0.01459939,0.001419455,0.002351867,0.00002479963,0.00005183452,0.002938523],"genre_scores_gemma":[0.996235,0.0004003013,0.0001021389,0.002252115,0.0004767903,0.0001946701,0.00004164418,0.00001656964,0.0002808271],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.3816451,"threshold_uncertainty_score":0.9995903,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2278049659794537,"score_gpt":0.4691366938755107,"score_spread":0.2413317278960571,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}