{"id":"W4389072922","doi":"10.4230/lipics.itcs.2024.47","title":"Distribution Testing with a Confused Collector","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Staatssekretariat für Bildung, Forschung und Innovation; Natural Sciences and Engineering Research Council of Canada; University of Waterloo","keywords":"Cluster analysis; Oracle; Computer science; Mathematics; Property testing; Sample (material); Artificial intelligence; Combinatorics; Algorithm; Physics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003124228,0.0003328541,0.0003415118,0.0001796631,0.0003345284,0.0002009483,0.001680498,0.0002411368,0.00001068673],"category_scores_gemma":[0.0003765429,0.0003591357,0.00009820767,0.001678289,0.0001225892,0.0002947423,0.002250528,0.0009038077,0.00009812464],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003780799,"about_ca_system_score_gemma":0.0004691489,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003852035,"about_ca_topic_score_gemma":0.00005743188,"domain_scores_codex":[0.9978641,0.0001889899,0.0001796428,0.00119358,0.0001469049,0.0004268312],"domain_scores_gemma":[0.9977437,0.0004563128,0.0003411865,0.001034796,0.0002761941,0.0001478271],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003198476,0.00003011276,0.01001053,0.00006338918,0.00007491269,0.000653332,0.0001126569,0.9419239,0.00001438457,0.04655312,0.0003485078,0.0001832358],"study_design_scores_gemma":[0.0006526646,0.00008321751,0.005898472,0.0002125099,0.00006163157,0.000007742585,0.00004330137,0.9836351,0.00002584806,0.008651127,0.0002363689,0.0004920096],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07487422,0.000006870975,0.9222699,0.0001659725,0.0005131718,0.0003099624,0.0000271394,0.001103815,0.0007289816],"genre_scores_gemma":[0.9878314,0.000006965044,0.0100166,0.00002965872,0.00009924686,0.000001999273,0.00006422557,0.00003333435,0.00191655],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9129572,"threshold_uncertainty_score":0.999886,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1153048172818834,"score_gpt":0.1998867443031431,"score_spread":0.08458192702125973,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}