{"id":"W4377004088","doi":"10.59275/j.melba.2022-2d93","title":"Rethinking Generalization: The Impact of Annotation Style on Medical Image Segmentation","year":2022,"lang":"en","type":"article","venue":"The Journal of Machine Learning for Biomedical Imaging","topic":"Radiomics and Machine Learning in Medical Imaging","field":"Medicine","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"NeuroRx Research (Canada); McGill University; Mila - Quebec Artificial Intelligence Institute","funders":"Genentech; MedDay Pharmaceuticals; Royal Academy of Engineering; International Progressive MS Alliance; Compute Canada; Western Canada Research Grid; Canadian Institute for Advanced Research; Teva Pharmaceutical Industries; Biogen","keywords":"Annotation; Computer science; Context (archaeology); Segmentation; Generalization; Artificial intelligence; Machine learning; Style (visual arts); Ground truth; Automatic image annotation; Image (mathematics); Natural language processing; Image retrieval; Information retrieval; Mathematics; Geography","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03502148,0.001450678,0.001509959,0.001097187,0.001191042,0.00290618,0.00249384,0.002805149,0.001105523],"category_scores_gemma":[0.08141629,0.0007995028,0.001702116,0.0009101861,0.00430267,0.004489143,0.004152125,0.004117706,0.0004985157],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001657149,"about_ca_system_score_gemma":0.00131562,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005276982,"about_ca_topic_score_gemma":0.005454166,"domain_scores_codex":[0.9901363,0.004668042,0.0006206401,0.003104534,0.001031146,0.0004393206],"domain_scores_gemma":[0.9344419,0.04060575,0.004697033,0.01592934,0.003416711,0.0009093525],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001729812,0.0004110339,0.08120061,0.0004829589,0.001043325,0.0003581431,0.002805527,0.4812798,0.03334701,0.02130557,0.004463293,0.371573],"study_design_scores_gemma":[0.0000716409,0.000292155,0.01640739,0.0001086007,0.0001636723,0.0002430579,0.0001675203,0.9269413,0.009296971,0.04438981,0.001824084,0.00009374992],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2726225,0.001417563,0.7179239,0.002228423,0.0002265082,0.0003067329,0.0003951022,0.002001583,0.002877616],"genre_scores_gemma":[0.8897205,0.0003925394,0.1052797,0.001357167,0.0002511021,0.0001993553,0.000753648,0.000485246,0.001560696],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.03502148,"threshold_uncertainty_score":0.1852135,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01342492877643922,"score_gpt":0.3338452928445346,"score_spread":0.3204203640680953,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}