{"id":"W4397023135","doi":"10.2196/53985","title":"Longitudinal Changes in Diagnostic Accuracy of a Differential Diagnosis List Developed by an AI-Based Symptom Checker: Retrospective Observational Study","year":2024,"lang":"en","type":"article","venue":"JMIR Formative Research","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Medical diagnosis; Observational study; Medicine; Differential diagnosis; Retrospective cohort study; Test (biology); Surgery; Radiology; Internal medicine; Pathology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004303957,0.0003660633,0.0007108831,0.001887281,0.0007076896,0.001099302,0.0007633338,0.0006459203,0.0006341578],"category_scores_gemma":[0.01589436,0.0004443683,0.001048146,0.00199095,0.000503395,0.001575577,0.0009771395,0.001094943,0.0002045765],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001007015,"about_ca_system_score_gemma":0.0008665617,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007220878,"about_ca_topic_score_gemma":0.00678034,"domain_scores_codex":[0.9960546,0.0009313424,0.0008709775,0.000810085,0.000898298,0.0004346778],"domain_scores_gemma":[0.9802757,0.003625795,0.01100138,0.001338003,0.002812817,0.0009463808],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.00009146926,0.00003634238,0.9991179,0.000009388898,0.00005095947,0.00002985875,0.0000692567,0.00002107793,0.00002994916,0.000006295287,0.00005548314,0.0004820283],"study_design_scores_gemma":[0.0000163781,0.000264821,0.9980168,0.00001594063,0.0001044756,0.0002327126,0.0004156787,0.0006300965,0.00008903284,0.00002502882,0.0001745807,0.00001447418],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9987613,0.0002903697,0.0001872397,0.00003663939,0.00001266349,0.00002641693,0.0005244876,0.000005288472,0.0001556566],"genre_scores_gemma":[0.9988229,0.00008883958,0.0001372323,0.00002751579,0.00001596138,0.00002541423,0.0008394131,0.000002328433,0.00004045341],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.007220878,"threshold_uncertainty_score":0.02276182,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3965696329557398,"score_gpt":0.5537246809353747,"score_spread":0.1571550479796349,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}