{"id":"W4417515342","doi":"10.48550/arxiv.2505.07033","title":"Introducing the O-Value: A Universal Standardization for Confusion-Matrix-Based Classification Performance Metrics","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Mitacs","keywords":"Robustness (evolution); Standardization; Metric (unit); Binary classification; Performance metric; One-class classification; Rank (graph theory); Percentile","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001424605,0.0003213228,0.0003370546,0.0005179012,0.0004915498,0.0002859161,0.002482388,0.000314827,0.000006765633],"category_scores_gemma":[0.0008870466,0.000275136,0.0001467289,0.001231265,0.0001190784,0.0004385299,0.0008882729,0.000574766,0.00001264039],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00058927,"about_ca_system_score_gemma":0.001160519,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002581661,"about_ca_topic_score_gemma":0.000003082017,"domain_scores_codex":[0.9973778,0.0002022388,0.000571774,0.00101745,0.0004983457,0.000332354],"domain_scores_gemma":[0.9953393,0.0005678366,0.0006683899,0.002475919,0.0008877192,0.00006080619],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003922825,0.0006799407,0.1182346,0.003273909,0.0004572562,0.000005860373,0.002633523,0.09595454,0.01514369,0.4796498,0.06691474,0.2166599],"study_design_scores_gemma":[0.0004574652,0.00007373745,0.01976823,0.0002503225,0.00007233998,8.964382e-7,0.00005513018,0.9131753,0.01971051,0.0008835275,0.04513314,0.0004194198],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01276398,0.0001300797,0.9776807,0.005627287,0.001041439,0.001467894,0.0002090325,0.0006802303,0.0003993534],"genre_scores_gemma":[0.8301283,0.0003142457,0.1669548,0.0006480109,0.0002396104,0.0004122801,0.0006616226,0.000028208,0.0006128685],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8173643,"threshold_uncertainty_score":0.9999701,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04293589265727419,"score_gpt":0.3100160745255524,"score_spread":0.2670801818682782,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}