{"id":"W7124253663","doi":"10.65109/rjqi2619","title":"Off-Policy Evolutionary Reinforcement Learning with Maximum Mutations","year":2022,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Scalability; Hyperparameter; Learning classifier system; Population; Evolutionary algorithm; Evolutionary computation; Sensitivity (control systems)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.000780804,0.0005522306,0.0004135216,0.0008892949,0.004067635,0.0004911725,0.001904883,0.00008582365,0.005826735],"category_scores_gemma":[0.0001824343,0.0005727425,0.0001909469,0.003208334,0.0003108582,0.001054324,0.00300988,0.001621325,0.0004941973],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001548649,"about_ca_system_score_gemma":0.002355027,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003241943,"about_ca_topic_score_gemma":0.000003954885,"domain_scores_codex":[0.9937373,0.0005364125,0.0009841991,0.001023954,0.002446992,0.001271078],"domain_scores_gemma":[0.997174,0.0002467129,0.000680267,0.001205672,0.0003382489,0.0003551089],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005170998,0.00008629981,0.001135052,0.00003174089,0.0001444007,0.00006548025,0.00267922,0.908958,0.0000188994,0.07566661,0.001962286,0.009200373],"study_design_scores_gemma":[0.00107122,0.002412989,0.0007843952,0.00003107555,0.00005098668,0.0002053259,0.001399944,0.8621307,0.00002085513,0.0003896163,0.1308396,0.0006633317],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0005559473,0.0002611662,0.9015673,0.004929502,0.00068089,0.0007904762,0.000002583411,0.0004224603,0.09078965],"genre_scores_gemma":[0.8484941,0.00009650531,0.02038272,0.001254534,0.0002340161,0.0002064291,0.00009588975,0.00006381336,0.129172],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8811846,"threshold_uncertainty_score":0.9996724,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01507967767866917,"score_gpt":0.2466790227555951,"score_spread":0.231599345076926,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}