{"id":"W4417515342","doi":"10.48550/arxiv.2505.07033","title":"Introducing the O-Value: A Universal Standardization for Confusion-Matrix-Based Classification Performance Metrics","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Mitacs","keywords":"Robustness (evolution); Standardization; Metric (unit); Binary classification; Performance metric; One-class classification; Rank (graph theory); Percentile","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01619783,0.003720904,0.002086652,0.01223107,0.001259482,0.00732875,0.003203922,0.002185829,0.003072342],"category_scores_gemma":[0.08536021,0.0006893247,0.00156698,0.008891549,0.004717684,0.008266573,0.006756593,0.00477908,0.002706438],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001727872,"about_ca_system_score_gemma":0.003269344,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001712068,"about_ca_topic_score_gemma":0.001502705,"domain_scores_codex":[0.9796039,0.005710375,0.002677076,0.003671674,0.007611793,0.0007250472],"domain_scores_gemma":[0.9598978,0.01666778,0.005452728,0.007168577,0.009900649,0.0009125373],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0003167292,0.0002915532,0.01642569,0.001310583,0.0004938823,0.0002841615,0.001535328,0.04689837,0.02674343,0.2322148,0.02850936,0.6449761],"study_design_scores_gemma":[0.00008935975,0.0007853368,0.01308281,0.001017142,0.0002600042,0.001698339,0.0009068559,0.3682911,0.03864294,0.4708291,0.1037462,0.0006508781],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.005964614,0.0007725293,0.9848872,0.0004118369,0.0003505638,0.0001888257,0.0007726453,0.002423481,0.004228322],"genre_scores_gemma":[0.1758981,0.00111756,0.8131558,0.0006496829,0.0007445611,0.001450914,0.002412226,0.001857123,0.002714069],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01619783,"threshold_uncertainty_score":0.08566332,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04293589265727419,"score_gpt":0.3100160745255524,"score_spread":0.2670801818682782,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}