{"id":"W4384070440","doi":"10.1148/ryai.220270","title":"The Subgroup Imperative: Chest Radiograph Classifier Generalization Gaps in Patient, Setting, and Pathology Subgroups","year":2023,"lang":"en","type":"article","venue":"Radiology Artificial Intelligence","topic":"COVID-19 diagnosis using AI","field":"Medicine","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"Royal University Hospital; Vector Institute; York University; Kingston Health Sciences Centre; Queen's University; Trillium Health Centre; University of Toronto","funders":"","keywords":"Medicine; Chest radiograph; Classifier (UML); Subgroup analysis; Radiography; Generalization; Radiology; Pathology; Artificial intelligence; Meta-analysis","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0185177,0.0008961956,0.0007619961,0.001339713,0.0006629147,0.001643443,0.00118744,0.001199706,0.0009495238],"category_scores_gemma":[0.05513154,0.0002394075,0.001417832,0.00072735,0.0009417254,0.001806893,0.001849875,0.001261407,0.0004561226],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001407028,"about_ca_system_score_gemma":0.002037097,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005332506,"about_ca_topic_score_gemma":0.00529302,"domain_scores_codex":[0.9924608,0.003716925,0.0008026096,0.00193011,0.0007399044,0.0003496044],"domain_scores_gemma":[0.9678789,0.01817196,0.00398863,0.006411353,0.002806608,0.0007426452],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002000923,0.0002459745,0.8577304,0.0002948958,0.0009666072,0.0002652497,0.0009257676,0.01353649,0.00353188,0.0007762657,0.005352138,0.1143733],"study_design_scores_gemma":[0.0004510163,0.002383945,0.6217628,0.000538149,0.001738455,0.00253843,0.003064101,0.3004487,0.01990395,0.02970159,0.01723333,0.0002355253],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9654791,0.001652863,0.0252177,0.002183703,0.0001378984,0.0002517643,0.002743678,0.0007091407,0.001624057],"genre_scores_gemma":[0.9885499,0.00007708575,0.008690589,0.0003460653,0.00006027067,0.00008806239,0.001960842,0.00004283166,0.0001843704],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0185177,"threshold_uncertainty_score":0.09793216,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03459874656786698,"score_gpt":0.3278431426661905,"score_spread":0.2932443960983235,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}