{"id":"W4411740634","doi":"10.2196/76097","title":"Evaluating the Quality and Understandability of Radiology Report Summaries Generated by ChatGPT: Survey Study","year":2025,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Preprint; Quality (philosophy); Medical physics; Computer science; Medicine; World Wide Web","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01281637,0.0003128818,0.0004916485,0.001717436,0.0003148276,0.001038256,0.0005051247,0.0005512951,0.001087376],"category_scores_gemma":[0.08249211,0.0002510968,0.0008093898,0.00110561,0.0006070371,0.001381685,0.001220433,0.0006782684,0.0004057122],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007768865,"about_ca_system_score_gemma":0.0006270115,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009559441,"about_ca_topic_score_gemma":0.0009778761,"domain_scores_codex":[0.9885451,0.006045431,0.002282981,0.0008097376,0.001877711,0.0004389966],"domain_scores_gemma":[0.8936831,0.05883656,0.02662056,0.003686991,0.0139179,0.003254934],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000750242,0.001003107,0.9423648,0.0004902306,0.0003357897,0.0003151964,0.01388817,0.0004841562,0.001348465,0.00006541602,0.001346219,0.03760817],"study_design_scores_gemma":[0.0000972376,0.003528581,0.976493,0.0001922628,0.0002240131,0.001460966,0.009234749,0.003872183,0.001992087,0.0001073657,0.002697659,0.00009987521],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9984514,0.0001300491,0.0006713318,0.00008658792,0.000006073504,0.0001159278,0.0002668477,0.00002822515,0.0002436189],"genre_scores_gemma":[0.9978374,0.0001631302,0.001218181,0.00009202822,0.00001634076,0.0001564181,0.0003870335,0.00001162105,0.0001178927],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01281637,"threshold_uncertainty_score":0.06778026,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.6802748778391188,"score_gpt":0.6724091685713862,"score_spread":0.007865709267732557,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}