{"id":"W4416901397","doi":"10.15441/ceem.25.153","title":"Automated chain-of-thought evaluation framework for large language model–generated emergency department documentation: a simulation-based study","year":2025,"lang":"en","type":"article","venue":"Clinical and Experimental Emergency Medicine","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"Samsung","keywords":"Emergency department; Workload; Documentation; Emergency medical services; Expert system","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0195465,0.001050304,0.0007063844,0.001298033,0.0005764356,0.001708493,0.001601512,0.0008485743,0.00147217],"category_scores_gemma":[0.05678266,0.0005375628,0.0009280103,0.0005842274,0.0007516999,0.001262594,0.001453888,0.0008274848,0.0002157173],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003627043,"about_ca_system_score_gemma":0.003464676,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01346397,"about_ca_topic_score_gemma":0.01263869,"domain_scores_codex":[0.9888154,0.008631668,0.0006758946,0.0006757184,0.0009465041,0.0002548195],"domain_scores_gemma":[0.936349,0.04923035,0.003703153,0.00296877,0.006717779,0.001030825],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.006406855,0.00759025,0.1142337,0.00140758,0.0005485056,0.0005122012,0.007801757,0.6162192,0.01152147,0.005040968,0.002480209,0.2262373],"study_design_scores_gemma":[0.0005198665,0.002222414,0.008978758,0.0001146059,0.00009816534,0.0001114991,0.0005433778,0.9812924,0.004178153,0.0007183661,0.001138564,0.00008368404],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8756211,0.0001458381,0.1198662,0.000146364,0.00002578849,0.001918604,0.0002402866,0.0009037104,0.001131988],"genre_scores_gemma":[0.8385985,0.00005509079,0.1599167,0.00004248083,0.00001069043,0.0008236876,0.0002889666,0.00004988258,0.0002140874],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0195465,"threshold_uncertainty_score":0.103373,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2238047675465595,"score_gpt":0.5876967528501084,"score_spread":0.3638919853035489,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}