{"id":"W4409259931","doi":"10.1371/journal.pdig.0000811","title":"Subgroup evaluation to understand performance gaps in deep learning-based classification of regions of interest on mammography","year":2025,"lang":"en","type":"article","venue":"PLOS Digital Health","topic":"AI in cancer detection","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"York University","funders":"National Cancer Institute","keywords":"False positive paradox; Medicine; Mammography; Univariate; Artificial intelligence; Multivariate statistics; Subgroup analysis; Convolutional neural network; Breast cancer; Internal medicine; Computer science; Machine learning; Confidence interval; Cancer","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0119253,0.001537728,0.001965423,0.00242197,0.0003103627,0.001284216,0.001264755,0.001054167,0.001103206],"category_scores_gemma":[0.02998114,0.0002443758,0.001986152,0.001114933,0.0004572163,0.001400557,0.001327485,0.0007361875,0.0005138791],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009853349,"about_ca_system_score_gemma":0.00103763,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005067951,"about_ca_topic_score_gemma":0.004740835,"domain_scores_codex":[0.9962345,0.001508082,0.0005434104,0.0007309917,0.0007119158,0.0002710805],"domain_scores_gemma":[0.9901497,0.005557282,0.0008048167,0.001883216,0.001299328,0.0003056841],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.007033593,0.0004504548,0.6090596,0.0008517891,0.00312026,0.0008336412,0.0005430507,0.09660356,0.0111028,0.002093351,0.009542365,0.2587656],"study_design_scores_gemma":[0.0003646516,0.00355425,0.1685941,0.0003267962,0.002325881,0.001721376,0.001294846,0.7683998,0.02582477,0.01647744,0.01096782,0.0001482146],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9532942,0.006026783,0.03173789,0.001120514,0.0001388655,0.0002341419,0.004444422,0.001143651,0.001859478],"genre_scores_gemma":[0.9851902,0.0003779714,0.007998452,0.0001851356,0.00006773993,0.00009216477,0.005618403,0.00009638524,0.0003735047],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0119253,"threshold_uncertainty_score":0.06306779,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09049813221488646,"score_gpt":0.3237286303025327,"score_spread":0.2332304980876462,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}