{"id":"W2991523350","doi":"10.1109/tmi.2020.3006437","title":"Confidence Calibration and Predictive Uncertainty Estimation for Deep Medical Image Segmentation","year":2020,"lang":"en","type":"article","venue":"IEEE Transactions on Medical Imaging","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":341,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"National Institute of Biomedical Imaging and Bioengineering; Natural Sciences and Engineering Research Council of Canada; Canadian Institutes of Health Research; National Institutes of Health","keywords":"Dice; Segmentation; Normalization (sociology); Image segmentation; Calibration; Convolutional neural network; Pattern recognition (psychology); Medical imaging","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006254786,0.001070949,0.0008013769,0.001467363,0.0005195004,0.001395204,0.001623986,0.00168088,0.0008864488],"category_scores_gemma":[0.03369397,0.0007029336,0.0005967105,0.0006442248,0.001994256,0.002295045,0.002332435,0.001975738,0.0001972774],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001945106,"about_ca_system_score_gemma":0.001185365,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002952145,"about_ca_topic_score_gemma":0.002469255,"domain_scores_codex":[0.9979997,0.0007541005,0.0001218349,0.0004316031,0.0005805593,0.000112098],"domain_scores_gemma":[0.9896448,0.006235453,0.00140094,0.001270404,0.001199272,0.0002491875],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001951115,0.00003269109,0.002861234,0.00008670505,0.00006986761,0.00007902781,0.0001561351,0.914376,0.005642503,0.01114153,0.0007539318,0.06460529],"study_design_scores_gemma":[0.000003215407,0.00002485306,0.0005311672,0.00002006204,0.000007457709,0.00003869132,0.000007616855,0.9889321,0.003872769,0.006334327,0.0002151687,0.0000124478],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05417057,0.0007330566,0.9426609,0.0004049733,0.0000340408,0.00003907534,0.00008608492,0.0008733743,0.0009979378],"genre_scores_gemma":[0.8796517,0.0003381674,0.1184471,0.0002256543,0.00005967712,0.00006023926,0.0002599909,0.00020207,0.0007554645],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006254786,"threshold_uncertainty_score":0.03307891,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01186382904086464,"score_gpt":0.2884710260404177,"score_spread":0.2766071969995531,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}