{"id":"W4417474898","doi":"10.64898/2025.12.16.25342438","title":"A medically grounded LLM agent–based tool to detect patient safety events in medical records","year":2025,"lang":"en","type":"article","venue":"medRxiv","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Hallucinating; Patient safety; Probabilistic logic; Medical record; Adverse effect; Clinical decision making; Key (lock); MEDLINE","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003418358,0.001273493,0.0005846164,0.004425558,0.00075285,0.001967624,0.001753723,0.001581368,0.005933516],"category_scores_gemma":[0.02287519,0.0005310833,0.001155155,0.0009425226,0.0004616552,0.001956341,0.002527429,0.001389902,0.001750288],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001355865,"about_ca_system_score_gemma":0.00229844,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007915915,"about_ca_topic_score_gemma":0.01547956,"domain_scores_codex":[0.99744,0.0008855104,0.0003719049,0.0005956676,0.0006376304,0.00006925608],"domain_scores_gemma":[0.9884529,0.007644073,0.001356882,0.001195903,0.001018477,0.0003318379],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001516916,0.001646308,0.06115567,0.002108926,0.001002241,0.003065579,0.002647966,0.1936314,0.01837622,0.0233752,0.0593178,0.6321559],"study_design_scores_gemma":[0.0000825945,0.00009896095,0.002143796,0.00009864388,0.00007367898,0.0002181327,0.0001691682,0.9691527,0.00414852,0.01066818,0.01310447,0.00004117673],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06036214,0.0005511758,0.8106267,0.002683106,0.0001883658,0.001690204,0.0108002,0.1084808,0.00461736],"genre_scores_gemma":[0.2794609,0.0001676049,0.7088961,0.0007638988,0.0000591932,0.0005831489,0.008118198,0.0005006029,0.001450359],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007915915,"threshold_uncertainty_score":0.0198496,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01267384909878684,"score_gpt":0.2998256056496219,"score_spread":0.287151756550835,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}