{"id":"W4386172820","doi":"10.2196/49995","title":"Comparison of Diagnostic and Triage Accuracy of Ada Health and WebMD Symptom Checkers, ChatGPT, and Physicians for Patients in an Emergency Department: Clinical Data Analysis Study","year":2023,"lang":"en","type":"article","venue":"JMIR mhealth and uhealth","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":122,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"National Institute of General Medical Sciences; National Heart, Lung, and Blood Institute; Agency for Healthcare Research and Quality; Brown University","keywords":"Triage; Emergency department; Medical emergency; Health care; Medicine; Nursing","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009304776,0.0003451053,0.0007281465,0.002108546,0.0002406695,0.000752228,0.0005705027,0.0005970271,0.0006005192],"category_scores_gemma":[0.04630731,0.0003496105,0.00075527,0.001160691,0.0005788228,0.0007291583,0.0008177995,0.000535118,0.0002171281],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000739072,"about_ca_system_score_gemma":0.0006335914,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003005643,"about_ca_topic_score_gemma":0.003154663,"domain_scores_codex":[0.9905674,0.005300668,0.001273216,0.001208554,0.001369713,0.0002805763],"domain_scores_gemma":[0.9347782,0.04585636,0.009292899,0.002729606,0.005755619,0.001587251],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001613932,0.0001521114,0.9931231,0.00003299046,0.000178502,0.00002763917,0.0002016548,0.0002162675,0.000154563,0.00001366793,0.000147551,0.004138089],"study_design_scores_gemma":[0.000239497,0.001818288,0.9870825,0.00002577853,0.0002153545,0.0002383863,0.0003172914,0.009013551,0.0007032417,0.00003717166,0.0002898574,0.00001914411],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9989166,0.0001083329,0.0003313711,0.00003305897,0.000009703084,0.00004671302,0.0003107086,0.00001079824,0.000232817],"genre_scores_gemma":[0.9984549,0.00004339756,0.0007272421,0.0000374562,0.00001339652,0.00004718553,0.0006180358,0.000004203711,0.0000541122],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.009304776,"threshold_uncertainty_score":0.04920894,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4175092999148154,"score_gpt":0.6037634739921173,"score_spread":0.1862541740773018,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}