{"id":"W4386710076","doi":"10.2196/48808","title":"ChatGPT-Generated Differential Diagnosis Lists for Complex Case–Derived Clinical Vignettes: Diagnostic Accuracy Evaluation","year":2023,"lang":"en","type":"article","venue":"JMIR Medical Informatics","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":135,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Differential diagnosis; Medical diagnosis; Medicine; Radiology; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03211575,0.00100449,0.0009886888,0.008359323,0.0006669479,0.001709628,0.00187581,0.001124492,0.00423564],"category_scores_gemma":[0.2288733,0.0005448966,0.001553309,0.002667364,0.0005922162,0.002119879,0.003074906,0.0008355965,0.001764208],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001319803,"about_ca_system_score_gemma":0.001682201,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001555095,"about_ca_topic_score_gemma":0.002389101,"domain_scores_codex":[0.9779007,0.01407412,0.00304724,0.001720924,0.002903553,0.0003535287],"domain_scores_gemma":[0.6340344,0.3108282,0.01905411,0.01292482,0.02028402,0.002874489],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.008167415,0.001431406,0.4738343,0.008788342,0.001273639,0.00280529,0.008086057,0.01337016,0.005511296,0.001606657,0.02458216,0.4505432],"study_design_scores_gemma":[0.002527845,0.00488821,0.3251768,0.004716713,0.003426142,0.0162405,0.008362578,0.5476813,0.03700813,0.007730876,0.0414755,0.0007654444],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8614919,0.003478621,0.1030315,0.001417771,0.0005923267,0.006779505,0.009579294,0.007783015,0.005846113],"genre_scores_gemma":[0.8147016,0.001340043,0.1700369,0.0003997716,0.0002305325,0.003369842,0.008713664,0.0002685546,0.000939045],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03211575,"threshold_uncertainty_score":0.1698463,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3661866926666326,"score_gpt":0.5378131142135208,"score_spread":0.1716264215468882,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}