{"id":"W4406090644","doi":"10.1186/s12911-024-02830-7","title":"External validation of AI-based scoring systems in the ICU: a systematic review and meta-analysis","year":2025,"lang":"en","type":"review","venue":"BMC Medical Informatics and Decision Making","topic":"Sepsis Diagnosis and Treatment","field":"Medicine","cited_by":36,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Charité – Universitätsmedizin Berlin; European Commission; Alexander von Humboldt-Stiftung","keywords":"Overfitting; Medicine; Reliability (semiconductor); MEDLINE; Intensive care unit; Health informatics; External validity; Receiver operating characteristic; Intensive care; Computer science; Medical physics; Data mining; Machine learning; Intensive care medicine; Statistics; Public health; Pathology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06361213,0.002601476,0.01632913,0.00996294,0.0008429539,0.00492988,0.003047808,0.002309454,0.002775565],"category_scores_gemma":[0.1722462,0.001375727,0.03125934,0.01170929,0.001518627,0.003359737,0.002382244,0.002223842,0.0003953181],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003187673,"about_ca_system_score_gemma":0.005149053,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005039259,"about_ca_topic_score_gemma":0.01082936,"domain_scores_codex":[0.9466958,0.02554653,0.01696,0.004014484,0.005968014,0.0008152742],"domain_scores_gemma":[0.7585703,0.1975909,0.02766215,0.006330286,0.009224775,0.0006216861],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"systematic_review","study_design_gemma":"meta_analysis","study_design_scores_codex":[0.001346033,0.00002587095,0.01406455,0.5115356,0.4494882,0.0001117238,0.0001522687,0.0006072324,0.0001508296,0.0002656938,0.0009883652,0.02126364],"study_design_scores_gemma":[0.0005166369,0.0002150544,0.01221688,0.1283176,0.8537382,0.0001758469,0.00009703798,0.000475947,0.0002292264,0.0006075491,0.003354328,0.00005561809],"study_design_candidate":"meta_analysis","study_design_consensus":null,"genre_codex":"review","genre_gemma":"review","genre_scores_codex":[0.004342746,0.9926252,0.001017024,0.000346592,0.0001355043,0.0003422909,0.0008638344,0.00002755358,0.0002991819],"genre_scores_gemma":[0.2394141,0.7472669,0.005361085,0.001872209,0.0005379356,0.002301381,0.002854004,0.0001004938,0.0002918347],"genre_candidate":"review","genre_consensus":"review","teacher_disagreement_score":0.06361213,"threshold_uncertainty_score":0.3364171,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2735414778019841,"score_gpt":0.4761514850411881,"score_spread":0.202610007239204,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}