{"id":"W4412652201","doi":"10.1177/08465371251360591","title":"Chain-of-Thought Reasoning Improves ChatGPT’s Diagnostic Accuracy in Radiology","year":2025,"lang":"en","type":"article","venue":"Canadian Association of Radiologists Journal","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"McGill University; London Health Sciences Centre","funders":"","keywords":"Medicine; Medical physics; Radiology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005073772,0.0009029274,0.0007414112,0.002055277,0.0008374562,0.002649481,0.0018805,0.002731108,0.01189795],"category_scores_gemma":[0.06231681,0.000418091,0.001164991,0.0008112592,0.0006167628,0.003120855,0.001955789,0.002035724,0.00294043],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001026388,"about_ca_system_score_gemma":0.003099897,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008160123,"about_ca_topic_score_gemma":0.01071235,"domain_scores_codex":[0.9969583,0.001184078,0.0003504583,0.000718873,0.0005939252,0.0001944884],"domain_scores_gemma":[0.9526142,0.03819843,0.001523935,0.002530874,0.003686403,0.001446182],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.01096472,0.001423321,0.09394938,0.001761299,0.0009174442,0.002972715,0.00126125,0.02465064,0.01282461,0.003483393,0.03485329,0.8109381],"study_design_scores_gemma":[0.002821866,0.002779464,0.05631936,0.001862877,0.002370887,0.009711027,0.002067814,0.7647218,0.04818742,0.07275321,0.03589793,0.0005063753],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6410536,0.008701613,0.2853445,0.009702696,0.003049123,0.001178589,0.005583191,0.01916562,0.02622096],"genre_scores_gemma":[0.8487369,0.0008708266,0.1422878,0.001475682,0.000672914,0.0001062485,0.002807072,0.0003154607,0.002727132],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01189795,"threshold_uncertainty_score":0.03980261,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03792235010181005,"score_gpt":0.3649183040570648,"score_spread":0.3269959539552548,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}