{"id":"W3089548822","doi":"","title":"Stable Policy Optimization via Off-Policy Divergence Regularization.","year":2020,"lang":"en","type":"article","venue":"Uncertainty in Artificial Intelligence","topic":"Adversarial Robustness in Machine Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Université de Montréal","funders":"","keywords":"Reinforcement learning; Benchmark (surveying); Regularization (linguistics); Computer science; Divergence (linguistics); Stability (learning theory); Trust region; Mathematical optimization; Adversarial system; Optimization problem; Range (aeronautics); Term (time); Artificial intelligence; Machine learning; Algorithm; Mathematics; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002232498,0.00100669,0.001154027,0.0005718041,0.0004594787,0.000936463,0.001201261,0.001405468,0.001693182],"category_scores_gemma":[0.0114123,0.0005459858,0.0006003701,0.0004570087,0.001853207,0.001432103,0.002070164,0.002493246,0.0004611632],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001072405,"about_ca_system_score_gemma":0.001705835,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002708417,"about_ca_topic_score_gemma":0.002241723,"domain_scores_codex":[0.999162,0.0003334235,0.00004215943,0.000172026,0.0002085713,0.00008183489],"domain_scores_gemma":[0.9963697,0.002504192,0.0003725966,0.0002939764,0.0002965688,0.0001629683],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000105592,0.00006238483,0.0005791443,0.00005605361,0.00003992294,0.00004767982,0.00006378171,0.9411291,0.001460084,0.02118924,0.001164668,0.03410234],"study_design_scores_gemma":[0.000005127191,0.00001626491,0.00002907492,0.000003798218,0.000001961901,0.000006969516,0.000002787388,0.9945575,0.000266269,0.004969096,0.0001389619,0.000002279067],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01402742,0.0002084649,0.9835998,0.0001967545,0.00003768924,0.00004380046,0.00002625428,0.000342609,0.001517311],"genre_scores_gemma":[0.8231747,0.0001956484,0.1725574,0.0002789431,0.00005643956,0.0001921453,0.0001694598,0.0002083231,0.003166912],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002708417,"threshold_uncertainty_score":0.01180667,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03451898926511433,"score_gpt":0.2957511071451971,"score_spread":0.2612321178800828,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}