{"id":"W2969609970","doi":"10.48550/arxiv.1809.04729","title":"A Less Biased Evaluation of Out-of-distribution Sample Detectors","year":2018,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Anomaly Detection Techniques and Applications","field":"Computer Science","cited_by":21,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Outlier; Computer science; Sample (material); Artificial intelligence; Set (abstract data type); Machine learning; Population; Scheme (mathematics); Data mining; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0005801377,0.0001519672,0.0002239142,0.0001616097,0.00008526845,0.00002090361,0.0008902142,0.0002071566,0.00002529267],"category_scores_gemma":[0.00007047929,0.0001799913,0.0001721204,0.0005446345,0.0001345098,0.0001358348,0.0005870431,0.0001655402,0.000007303679],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001993479,"about_ca_system_score_gemma":0.0002454073,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003505501,"about_ca_topic_score_gemma":0.00006285939,"domain_scores_codex":[0.9987671,0.000142894,0.0002457441,0.0005438598,0.0001614672,0.0001388968],"domain_scores_gemma":[0.9975529,0.00008841166,0.0005124194,0.0009830636,0.0008043525,0.0000588712],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001911911,0.001554039,0.01395103,0.0007540859,0.0006827553,0.00001256355,0.001553706,0.1782741,0.006582259,0.6366433,0.002298289,0.1575027],"study_design_scores_gemma":[0.0003729186,0.0001205938,0.00260671,0.00008782791,0.0001687123,9.810553e-7,0.00007716699,0.8649302,0.03953662,0.09153295,0.0002625086,0.0003028777],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3942839,0.000008274114,0.6049796,0.000008910922,0.0001349011,0.0002528941,0.00007395736,0.00009543828,0.0001621162],"genre_scores_gemma":[0.9960495,0.00001928383,0.003793172,0.000004470188,0.00003155951,0.000004780609,0.00005631333,0.000006821188,0.00003408734],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.686656,"threshold_uncertainty_score":0.733983,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1871613230210542,"score_gpt":0.2461036610132556,"score_spread":0.05894233799220136,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}