{"id":"W4390741581","doi":"10.1007/s43678-023-00616-w","title":"Repeatability, reproducibility, and diagnostic accuracy of a commercial large language model (ChatGPT) to perform emergency department triage using the Canadian triage and acuity scale","year":2024,"lang":"en","type":"article","venue":"Canadian Journal of Emergency Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":39,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Alberta","funders":"","keywords":"Triage; Medicine; Emergency department; Repeatability; Medical emergency; Scale (ratio); Emergency medicine; Nursing; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03131345,0.0007295531,0.0005262328,0.00136923,0.0009052175,0.001918698,0.001297749,0.001331971,0.0006942853],"category_scores_gemma":[0.1060335,0.0005708568,0.001183491,0.0007181561,0.00150275,0.001237543,0.00159337,0.001270125,0.0007274904],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001579938,"about_ca_system_score_gemma":0.001917215,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02959124,"about_ca_topic_score_gemma":0.03993041,"domain_scores_codex":[0.9767115,0.01003878,0.002249555,0.004410018,0.005899549,0.0006905175],"domain_scores_gemma":[0.9162401,0.04421669,0.005464264,0.01141486,0.02143941,0.001224621],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.005147132,0.0009322811,0.8636867,0.0002254524,0.002527316,0.0001547603,0.005437938,0.007853406,0.01213205,0.0009379687,0.006335263,0.09462974],"study_design_scores_gemma":[0.0003305149,0.002025831,0.9216532,0.00009200503,0.0008166005,0.0005091631,0.001269319,0.05965589,0.008922917,0.0008457084,0.00364793,0.0002310261],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9803613,0.0003829702,0.01483179,0.0001896515,0.0003628975,0.0003285827,0.0009245506,0.0004058348,0.002212412],"genre_scores_gemma":[0.9913703,0.00006540788,0.006301199,0.000175868,0.00005194138,0.0002087038,0.0008783475,0.0001562047,0.0007919839],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03131345,"threshold_uncertainty_score":0.1656033,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2764534155231425,"score_gpt":0.4821462013468307,"score_spread":0.2056927858236882,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}