{"id":"W4408280719","doi":"10.1109/access.2025.3549702","title":"Machine Learning Evaluation Metric Discrepancies Across Programming Languages and Their Components in Medical Imaging Domains: Need for Standardization","year":2025,"lang":"en","type":"article","venue":"IEEE Access","topic":"Radiomics and Machine Learning in Medical Imaging","field":"Medicine","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"Teck (Canada); University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Standardization; Computer science; Metric (unit); Programming language; Artificial intelligence; Medical imaging; Natural language processing; Machine learning","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002450302,0.0001530601,0.0003329209,0.0003167604,0.000205727,0.0001807022,0.0001525249,0.00006763948,0.00001271929],"category_scores_gemma":[0.002981829,0.0001175711,0.0000564081,0.000621134,0.0001131705,0.0002253276,0.00009416799,0.0003822122,2.694179e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001237421,"about_ca_system_score_gemma":0.0001055262,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004677112,"about_ca_topic_score_gemma":0.00008179576,"domain_scores_codex":[0.998464,0.000135044,0.000337664,0.0003054424,0.0004455793,0.000312242],"domain_scores_gemma":[0.999154,0.0003597961,0.0001059755,0.0001314657,0.0001468747,0.0001018289],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000126837,0.00007657463,0.32751,0.0002667283,0.00005907328,0.00001511508,0.0008588338,0.0006170517,0.001062803,0.0001116951,0.0000700888,0.6692252],"study_design_scores_gemma":[0.006056778,0.00005583706,0.07984294,0.0007826384,0.00009973928,0.00003192307,0.001457147,0.9012712,0.0008102555,0.0004573498,0.00894959,0.0001846044],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7770172,0.003444158,0.213338,0.004556061,0.0002807502,0.0009388498,0.00000952459,0.00009915766,0.0003162262],"genre_scores_gemma":[0.9978124,0.0001916195,0.001002319,0.0005598726,0.0001106332,0.0001055539,0.0001324392,0.00002142301,0.00006376392],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.9006541,"threshold_uncertainty_score":0.4794411,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02084814554002965,"score_gpt":0.4047388944958217,"score_spread":0.3838907489557921,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}