{"id":"W4417471048","doi":"10.1109/nss/mic/rtsd57106.2025.11286722","title":"AllMetrics: A Unified Python Library for Standardized Metric Evaluation in Machine Learning","year":2025,"lang":"","type":"article","venue":"","topic":"Machine Learning and Data Classification","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Teck (Canada); University of British Columbia","funders":"","keywords":"Python (programming language); Standardization; Metric (unit); Debugging; Modular design; Modular programming; Product metric; Performance metric","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006992069,0.003717157,0.002065295,0.0035702,0.0009921442,0.004303205,0.006559928,0.001234436,0.02517439],"category_scores_gemma":[0.02685736,0.002062724,0.002968373,0.002998644,0.001789505,0.004842495,0.006387237,0.005256532,0.02543217],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001821907,"about_ca_system_score_gemma":0.007014064,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004828535,"about_ca_topic_score_gemma":0.005000228,"domain_scores_codex":[0.9931383,0.001374652,0.001039954,0.001046157,0.002972217,0.0004287953],"domain_scores_gemma":[0.9912539,0.002946775,0.001042674,0.002022977,0.002310789,0.0004228956],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0008497277,0.0004776654,0.007660791,0.004296997,0.0007722812,0.000556422,0.0008037641,0.043151,0.01374005,0.04294271,0.5500238,0.3347248],"study_design_scores_gemma":[0.0004617605,0.0004169771,0.007925122,0.0009860325,0.0002115689,0.0008654756,0.0001930673,0.3918502,0.05263811,0.112033,0.4317276,0.0006911533],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"methods","genre_gemma":"software","genre_scores_codex":[0.002057312,0.0003465598,0.5410226,0.0003006663,0.0001851626,0.0004848346,0.01333695,0.4376471,0.004618727],"genre_scores_gemma":[0.05000738,0.001261238,0.6846409,0.001489433,0.000226206,0.005425725,0.05647497,0.1918467,0.00862751],"genre_candidate":"software","genre_consensus":null,"teacher_disagreement_score":0.02517439,"threshold_uncertainty_score":0.08421671,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03454321820544654,"score_gpt":0.3235457328130359,"score_spread":0.2890025146075894,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}