{"id":"W4361228074","doi":"10.1101/2023.03.26.23286718","title":"Diagnosing and remediating harmful data shifts for the responsible deployment of clinical AI models","year":2023,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Machine Learning in Healthcare","field":"Computer Science","cited_by":8,"is_retracted":false,"has_abstract":true,"ca_institutions":"St. Michael's Hospital; Vector Institute; Hospital for Sick Children; University of Toronto","funders":"Vector Institute; University of Toronto; Canadian Institute for Advanced Research","keywords":"Software deployment; Harm; Leverage (statistics); Demographics; Community hospital; Warning system; Health care; Transfer of learning; Medical diagnosis; Medicine; Machine learning; Artificial intelligence; Medical emergency; Emergency medicine; Computer science; Psychology; Demography; Nursing","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01226203,0.001614908,0.0008726094,0.001388,0.001095739,0.002352909,0.002831561,0.001575904,0.00115208],"category_scores_gemma":[0.07784909,0.001055187,0.0005557296,0.0007441814,0.001460642,0.003985812,0.003807797,0.003956072,0.0005745865],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002397943,"about_ca_system_score_gemma":0.005955776,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01482212,"about_ca_topic_score_gemma":0.01270411,"domain_scores_codex":[0.9942438,0.002266312,0.0005498301,0.001171949,0.00114415,0.0006240397],"domain_scores_gemma":[0.9520264,0.02327162,0.005872394,0.007460762,0.009621168,0.001747658],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008983447,0.0009612896,0.2331338,0.0002614195,0.0002024275,0.0008087729,0.001765939,0.5677368,0.01386742,0.003090024,0.006237896,0.1710358],"study_design_scores_gemma":[0.00003569389,0.0002142835,0.007913877,0.00004096296,0.00003033731,0.00008697269,0.0006174965,0.9777663,0.007799562,0.004212852,0.001253221,0.0000285047],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8063038,0.0003872973,0.1811728,0.003914725,0.0002430221,0.0005125422,0.0004897222,0.004862854,0.002113309],"genre_scores_gemma":[0.9621348,0.00005520197,0.03648508,0.0002768989,0.00003142732,0.0001024745,0.000394699,0.0001118892,0.0004075928],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.987738,"threshold_uncertainty_score":0.0648486,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3898331686800192,"score_gpt":0.4786072066113161,"score_spread":0.0887740379312969,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}