{"id":"W4390546778","doi":"10.1016/j.annemergmed.2023.11.018","title":"Evaluating the Reliability of a Remote Acuity Prediction Tool in a Canadian Academic Emergency Department","year":2024,"lang":"en","type":"article","venue":"Annals of Emergency Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"Health Sciences Centre; University of Toronto; Schwartz/Reisman Emergency Medicine Institute; Sunnybrook Health Science Centre","funders":"","keywords":"Triage; Medicine; Emergency department; Inter-rater reliability; Kappa; Retrospective cohort study; Cohen's kappa; Machine learning; Algorithm; Confidence interval; Artificial intelligence; Emergency medicine; Psychiatry; Statistics; Computer science; Rating scale; Surgery; Internal medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02138158,0.0008645436,0.0006177889,0.00268531,0.001315205,0.001510018,0.00203005,0.0005964524,0.001148974],"category_scores_gemma":[0.07082822,0.0003671033,0.0008121,0.0022767,0.00110205,0.000674062,0.001777454,0.0007010201,0.0003184346],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.005720127,"about_ca_system_score_gemma":0.009170692,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.4256103,"about_ca_topic_score_gemma":0.4808863,"domain_scores_codex":[0.9848937,0.004486912,0.001543305,0.00193077,0.006350036,0.0007951433],"domain_scores_gemma":[0.952116,0.01551905,0.00458568,0.001827175,0.02448005,0.001472144],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006761855,0.0002099303,0.9366521,0.0002056991,0.0003303908,0.0001125761,0.001236907,0.003110544,0.0007342469,0.0001796134,0.001199148,0.05535254],"study_design_scores_gemma":[0.0001074673,0.0008623273,0.9448932,0.0001867697,0.000217114,0.000263089,0.002064652,0.04655382,0.001742141,0.0001609663,0.002862894,0.00008558733],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9903133,0.0004585699,0.004627403,0.00023675,0.00007506937,0.0004506,0.0009036405,0.0001278042,0.002806904],"genre_scores_gemma":[0.9903414,0.0001772544,0.007971834,0.00007476999,0.00003786475,0.0001744074,0.0007975321,0.00001466627,0.0004102428],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4256103,"threshold_uncertainty_score":0.846266,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4855746922995869,"score_gpt":0.5708030833107298,"score_spread":0.08522839101114288,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}