{"id":"W2964760189","doi":"","title":"Epsilon-BMC: A Bayesian Ensemble Approach to Epsilon-Greedy Exploration in Model-Free Reinforcement Learning","year":2020,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Bayesian probability; Computer science; Perspective (graphical); Mathematical optimization; Monotone polygon; Convergence (economics); Greedy algorithm; Simulated annealing; Bellman equation; Q-learning; Function (biology); Artificial intelligence; Algorithm; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002838571,0.00142701,0.002067519,0.001045208,0.0006846286,0.001207462,0.003540267,0.001893647,0.003693685],"category_scores_gemma":[0.009108119,0.001005281,0.0008545765,0.0008808664,0.001289458,0.001840669,0.003078525,0.003081339,0.0006971658],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001484751,"about_ca_system_score_gemma":0.002277185,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005312377,"about_ca_topic_score_gemma":0.008200532,"domain_scores_codex":[0.9983779,0.0006976387,0.00006542515,0.0002429954,0.0004478884,0.0001681346],"domain_scores_gemma":[0.9967998,0.002024778,0.000279172,0.0003059048,0.0003988081,0.0001915406],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009141703,0.00007839937,0.0005061624,0.00006207735,0.00006499034,0.00004483655,0.0000611681,0.912171,0.0008270399,0.02266209,0.001638698,0.06179214],"study_design_scores_gemma":[0.000006686601,0.00001872077,0.00002496346,0.000005512342,0.000004570794,0.000007545256,0.000002463411,0.9939336,0.0001751789,0.005573579,0.0002431651,0.000003981391],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003993938,0.00009208753,0.9940377,0.0001244771,0.00002276498,0.00003575724,0.00002606416,0.0004089334,0.001258205],"genre_scores_gemma":[0.5214713,0.0002294495,0.4726449,0.0004704847,0.0001121063,0.0005238735,0.0002457822,0.0004204298,0.003881712],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005312377,"threshold_uncertainty_score":0.01501197,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1159792376073298,"score_gpt":0.1931123848080355,"score_spread":0.07713314720070566,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}