{"id":"W4396646848","doi":"10.2196/59267","title":"Evaluating ChatGPT-4’s Accuracy in Identifying Final Diagnoses Within Differential Diagnoses Compared With Those of Physicians: Experimental Study for Diagnostic Cases","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":32,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Japan Society for the Promotion of Science; Dokkyo Medical University","keywords":"Medical diagnosis; Differential (mechanical device); Diagnostic accuracy; Medicine; Medical physics; Radiology; Engineering","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02742684,0.001317882,0.00128671,0.002817295,0.0009876705,0.001634763,0.001819334,0.00235036,0.002620636],"category_scores_gemma":[0.1583004,0.0006840648,0.001634807,0.00100432,0.001461149,0.003008579,0.003188341,0.001805263,0.001012768],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001431364,"about_ca_system_score_gemma":0.001437657,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00321237,"about_ca_topic_score_gemma":0.003201355,"domain_scores_codex":[0.9806479,0.01201998,0.002308225,0.002718176,0.00175314,0.0005525349],"domain_scores_gemma":[0.6557848,0.3086759,0.009811588,0.009936384,0.01112828,0.004663111],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.04762895,0.01062501,0.6138889,0.003907495,0.00298448,0.0017473,0.01043781,0.03014636,0.01252023,0.0009923823,0.007787921,0.2573331],"study_design_scores_gemma":[0.004365232,0.03190267,0.4283486,0.0008912962,0.003348392,0.004062105,0.006755954,0.4817539,0.02623763,0.005016542,0.006713375,0.0006042158],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9912384,0.0007002185,0.004463423,0.0001824726,0.0001482191,0.000748562,0.0005238047,0.0003953682,0.001599428],"genre_scores_gemma":[0.9778342,0.0002669913,0.01858238,0.0001756751,0.0001229591,0.0006917432,0.001530975,0.00008000692,0.0007150123],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9725732,"threshold_uncertainty_score":0.1450487,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5837778148836222,"score_gpt":0.6306624332768651,"score_spread":0.04688461839324287,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}