{"id":"W4397023135","doi":"10.2196/53985","title":"Longitudinal Changes in Diagnostic Accuracy of a Differential Diagnosis List Developed by an AI-Based Symptom Checker: Retrospective Observational Study","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Observational study; Medicine; Differential diagnosis; Retrospective cohort study; Test (biology); Surgery; Radiology; Internal medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00132027,0.0001699612,0.0003397166,0.0006296872,0.000178889,0.0000988112,0.0001813413,0.0001168384,0.0005258668],"category_scores_gemma":[0.002955319,0.0001436668,0.00005431189,0.001519622,0.0002034207,0.0004745705,0.00007149266,0.0007819866,0.00004830535],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000697667,"about_ca_system_score_gemma":0.0008986568,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002074755,"about_ca_topic_score_gemma":0.002400148,"domain_scores_codex":[0.9971212,0.0003780232,0.0006037785,0.0003922092,0.001030548,0.0004742298],"domain_scores_gemma":[0.9954237,0.003035545,0.00008423329,0.0002661163,0.001009891,0.000180476],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0002573642,0.002555038,0.9519208,0.0004981527,0.00005523253,0.00002454128,0.02504253,0.000003184799,0.0003736296,0.0002828201,0.003851017,0.01513571],"study_design_scores_gemma":[0.0002136152,0.002800857,0.9612439,0.0007707326,0.00001908834,0.000002579761,0.006779419,0.00479141,0.02234192,0.0004818119,0.0004092659,0.0001454106],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.992326,0.0002416754,0.0002315718,0.004828231,0.0002493555,0.001931183,0.00007874301,0.00004284242,0.00007038214],"genre_scores_gemma":[0.9969941,0.0001469441,0.00003707056,0.00008009372,0.0002184013,0.002170946,0.0002657155,0.0000237826,0.00006296398],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02196829,"threshold_uncertainty_score":0.5858563,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3965696329557398,"score_gpt":0.5537246809353747,"score_spread":0.1571550479796349,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}