{"id":"W4412078570","doi":"10.1038/s41467-025-60466-1","title":"Towards fair decentralized benchmarking of healthcare AI algorithms with the Federated Tumor Segmentation (FeTS) challenge","year":2025,"lang":"en","type":"article","venue":"Nature Communications","topic":"Radiomics and Machine Learning in Medical Imaging","field":"Medicine","cited_by":10,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; McGill University Health Centre; Centre Hospitalier Universitaire de Sherbrooke; Queen's University; Université de Sherbrooke; Alberta Children's Hospital; Hotchkiss Brain Institute; University of Alberta; University of Calgary; Artificial Intelligence in Medicine (Canada)","funders":"National Center for Advancing Translational Sciences; National Institute of Biomedical Imaging and Bioengineering; National Institute of General Medical Sciences; National Cancer Institute; Canadian Institutes of Health Research; Anschutz Medical Campus, University of Colorado; Sidney Kimmel Comprehensive Cancer Center; Faculty of Medicine and Health, University of Sydney; Université de Sherbrooke; School of Electronic Engineering and Computer Science, Queen Mary University of London; National Institutes of Health; Agencia Nacional de Investigación y Desarrollo; Universitätsklinikum Heidelberg; Universitätsspital Zürich; Canadian Institute for Advanced Research; Inselspital, Universitätsspital Bern; Universität Zürich; China Scholarship Council; Universidad de Concepción; McGill University; Conselho Nacional de Desenvolvimento Científico e Tecnológico; Queen's University; Islamic Azad University; Deutsche Forschungsgemeinschaft; School of Medicine, Indiana University; University of Bern; Universidad Carlos III de Madrid; Ministerstvo Zdravotnictví Ceské Republiky; Business Finland; Frederick National Laboratory for Cancer Research; Cancer Research UK; Varian Medical Systems; Wellcome Trust; Universidad Católica de Cuenca; Deutsches Krebsforschungszentrum; Thomas Jefferson University; Leidos; U.S. Department of Veterans Affairs; University of Pennsylvania; Escuela Superior Politécnica del Litoral; Kepler Universitätsklinikum; Queen Mary University of London; University of Patras; Ohio State University; Higher Education Commision, Pakistan; University of Toronto; Faculty of Arts and Sciences; Silesian University of Technology; Université du Luxembourg; National Science Foundation","keywords":"Benchmarking; Benchmark (surveying); Computer science; Segmentation; Artificial intelligence; Generalization; Machine learning; Algorithm; Federated learning; Data mining","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.02437891,0.001641214,0.002393731,0.001413358,0.001461463,0.005041571,0.004495063,0.003245555,0.002809802],"category_scores_gemma":[0.06393382,0.0007208442,0.001149096,0.001819058,0.002883715,0.004520277,0.005800214,0.003409359,0.001358578],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002641291,"about_ca_system_score_gemma":0.005532588,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004001258,"about_ca_topic_score_gemma":0.003270261,"domain_scores_codex":[0.9825544,0.01019726,0.0006919015,0.002355399,0.003055876,0.001145205],"domain_scores_gemma":[0.9697866,0.0133463,0.001535773,0.00821637,0.005344901,0.001770088],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001159644,0.0005368567,0.004186336,0.0003655902,0.0002534764,0.0001703255,0.00023405,0.861505,0.003628446,0.0326511,0.01832543,0.07698367],"study_design_scores_gemma":[0.00009903107,0.0002131211,0.000673171,0.00003721997,0.00001687308,0.00004689836,0.00009265141,0.9595621,0.002108334,0.03432779,0.002802063,0.00002073437],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.1647977,0.002118151,0.7992942,0.005606723,0.001001842,0.0008617431,0.001765557,0.009676128,0.01487791],"genre_scores_gemma":[0.765158,0.0003686538,0.226846,0.001144554,0.0002496714,0.0005809198,0.003158861,0.0007892384,0.001704132],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.9756211,"threshold_uncertainty_score":0.1289296,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0144003966555003,"score_gpt":0.3546559547238374,"score_spread":0.3402555580683371,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}