{"id":"W2916603395","doi":"10.24963/ijcai.2019/386","title":"Perturbed-History Exploration in Stochastic Multi-Armed Bandits","year":2019,"lang":"en","type":"preprint","venue":"","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Regret; Bernoulli's principle; Offset (computer science); Argument (complex analysis); Computer science; Optimism; Mathematical optimization; Mathematics; Psychology; Machine learning; Engineering; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003929804,0.001488003,0.00217784,0.0006902632,0.0006968204,0.001765208,0.002416021,0.002005874,0.002450776],"category_scores_gemma":[0.01647391,0.0009024656,0.000848662,0.001051719,0.002175214,0.002760215,0.002382964,0.00244262,0.0006481347],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00155934,"about_ca_system_score_gemma":0.001683602,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002010857,"about_ca_topic_score_gemma":0.0019627,"domain_scores_codex":[0.9973604,0.001403341,0.0001045149,0.0004045018,0.0004271201,0.0003001734],"domain_scores_gemma":[0.9888837,0.008665145,0.0009491665,0.0007261242,0.0004032735,0.000372604],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002845033,0.0000716036,0.000775057,0.00009114405,0.00005718496,0.00005658486,0.00006764755,0.9456394,0.0007034186,0.03062453,0.0009160354,0.02071297],"study_design_scores_gemma":[0.00002492405,0.00004114839,0.00006367992,0.00001443991,0.000007660645,0.00001264484,0.000005425802,0.9784172,0.0002596391,0.02090075,0.0002462218,0.000006365451],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04889896,0.001355649,0.9442977,0.0007872873,0.00007900374,0.0000942383,0.0001251492,0.0007590289,0.003602984],"genre_scores_gemma":[0.8686728,0.0006460401,0.1261109,0.000461267,0.0001357721,0.0003153983,0.000212409,0.0001847213,0.003260581],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003929804,"threshold_uncertainty_score":0.02078307,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.4035207061190713,"score_gpt":0.4707663724538747,"score_spread":0.06724566633480344,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}