{"id":"W4411025380","doi":"10.1001/jamanetworkopen.2025.13685","title":"Detecting and Remediating Harmful Data Shifts for the Responsible Deployment of Clinical AI Models","year":2025,"lang":"en","type":"article","venue":"JAMA Network Open","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":43,"is_retracted":false,"has_abstract":true,"ca_institutions":"St. Michael's Hospital; University Health Network; University of Toronto; Vector Institute; York University; Hospital for Sick Children","funders":"Canadian Institutes of Health Research","keywords":"Receiver operating characteristic; Medicine; Demographics; Harm; Pipeline (software); Emergency medicine; Artificial intelligence; Machine learning; Medical emergency; Computer science; Psychology; Demography; Internal medicine","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02266561,0.0009776973,0.0006609008,0.001993309,0.0008585287,0.002629533,0.00189657,0.001143108,0.001203164],"category_scores_gemma":[0.1199318,0.0005130121,0.0005721355,0.001022187,0.001217194,0.003395501,0.002843234,0.002018566,0.0006186532],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001798177,"about_ca_system_score_gemma":0.006819564,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006196936,"about_ca_topic_score_gemma":0.009091148,"domain_scores_codex":[0.9893176,0.005129825,0.0009999215,0.001411167,0.002724683,0.00041679],"domain_scores_gemma":[0.9105089,0.04223115,0.02091122,0.01012645,0.01453355,0.001688757],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0006657943,0.001146736,0.5930371,0.0005005184,0.0002771738,0.0001566243,0.001579264,0.07431114,0.007963763,0.001288847,0.005396003,0.3136772],"study_design_scores_gemma":[0.0001858718,0.002765095,0.207479,0.000479478,0.0002285264,0.0003675649,0.002114105,0.7437528,0.02406326,0.01023715,0.008132467,0.0001946128],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"methods","genre_scores_codex":[0.7018465,0.0008415432,0.2797588,0.007050242,0.000135382,0.001449015,0.001010343,0.003513111,0.004395076],"genre_scores_gemma":[0.9267777,0.0001712434,0.07135297,0.0004962701,0.00005688558,0.0002143836,0.0004771998,0.00006482611,0.0003885052],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.02266561,"threshold_uncertainty_score":0.1198686,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5452111985725556,"score_gpt":0.5722105086674241,"score_spread":0.02699931009486845,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}