{"id":"W4412078570","doi":"10.1038/s41467-025-60466-1","title":"Towards fair decentralized benchmarking of healthcare AI algorithms with the Federated Tumor Segmentation (FeTS) challenge","year":2025,"lang":"en","type":"article","venue":"Nature Communications","topic":"Radiomics and Machine Learning in Medical Imaging","field":"Medicine","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; McGill University Health Centre; Centre Hospitalier Universitaire de Sherbrooke; Queen's University; Université de Sherbrooke; Alberta Children's Hospital; Hotchkiss Brain Institute; University of Alberta; University of Calgary; Artificial Intelligence in Medicine (Canada)","funders":"National Center for Advancing Translational Sciences; National Institute of Biomedical Imaging and Bioengineering; National Institute of General Medical Sciences; National Cancer Institute; Canadian Institutes of Health Research; Anschutz Medical Campus, University of Colorado; Sidney Kimmel Comprehensive Cancer Center; Faculty of Medicine and Health, University of Sydney; Université de Sherbrooke; School of Electronic Engineering and Computer Science, Queen Mary University of London; National Institutes of Health; Agencia Nacional de Investigación y Desarrollo; Universitätsklinikum Heidelberg; Universitätsspital Zürich; Canadian Institute for Advanced Research; Inselspital, Universitätsspital Bern; Universität Zürich; China Scholarship Council; Universidad de Concepción; McGill University; Conselho Nacional de Desenvolvimento Científico e Tecnológico; Queen's University; Islamic Azad University; Deutsche Forschungsgemeinschaft; School of Medicine, Indiana University; University of Bern; Universidad Carlos III de Madrid; Ministerstvo Zdravotnictví Ceské Republiky; Business Finland; Frederick National Laboratory for Cancer Research; Cancer Research UK; Varian Medical Systems; Wellcome Trust; Universidad Católica de Cuenca; Deutsches Krebsforschungszentrum; Thomas Jefferson University; Leidos; U.S. Department of Veterans Affairs; University of Pennsylvania; Escuela Superior Politécnica del Litoral; Kepler Universitätsklinikum; Queen Mary University of London; University of Patras; Ohio State University; Higher Education Commision, Pakistan; University of Toronto; Faculty of Arts and Sciences; Silesian University of Technology; Université du Luxembourg; National Science Foundation","keywords":"Benchmarking; Benchmark (surveying); Computer science; Segmentation; Artificial intelligence; Generalization; Machine learning; Algorithm; Federated learning; Data mining","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003712187,0.0001168829,0.0002336832,0.0001010234,0.0003587505,0.00003130849,0.0003906609,0.0001074061,0.00001857907],"category_scores_gemma":[0.000175146,0.00007568293,0.0000594928,0.0004728282,0.0001964673,0.0000516248,0.0001225699,0.001451577,0.000001049566],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009365707,"about_ca_system_score_gemma":0.0003094667,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0002863503,"about_ca_topic_score_gemma":0.0003466277,"domain_scores_codex":[0.9989909,0.0001959288,0.0002461171,0.0001574965,0.0002418904,0.0001676804],"domain_scores_gemma":[0.9984973,0.0002061258,0.0001311816,0.0007724107,0.0003258261,0.00006713696],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0007186502,0.001685606,0.03764623,0.001105523,0.001551909,0.00003551894,0.008224766,0.0002310066,0.006008353,0.1392449,0.04038481,0.7631627],"study_design_scores_gemma":[0.01384589,0.00103424,0.1594379,0.003999224,0.00135785,0.0001969114,0.008702992,0.285017,0.004603285,0.001922032,0.5190084,0.0008741769],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"commentary","genre_gemma":"empirical","genre_scores_codex":[0.02897576,0.02700484,0.01452294,0.9189144,0.0003361569,0.001379866,0.00002121815,0.000159933,0.008684909],"genre_scores_gemma":[0.9710343,0.00150473,0.01976465,0.00731472,0.00003503568,0.0000414863,0.0001847522,0.00001399719,0.0001062617],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9420586,"threshold_uncertainty_score":0.630646,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0144003966555003,"score_gpt":0.3546559547238374,"score_spread":0.3402555580683371,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}