{"id":"W3128954025","doi":"10.1609/aaai.v35i9.16964","title":"Variance Penalized On-Policy and Off-Policy Actor-Critic","year":2021,"lang":"en","type":"article","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute; McGill University","funders":"","keywords":"Variance (accounting); Convergence (economics); Computer science; Reinforcement learning; Estimator; Moment (physics); Markov decision process; Expected return; Mathematical optimization; Minimum-variance unbiased estimator; Variance risk premium; Econometrics; Mathematics; Artificial intelligence; Markov process; Statistics; Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00254097,0.001320177,0.001445478,0.0006131416,0.0004092322,0.001252356,0.001997268,0.001692439,0.00237633],"category_scores_gemma":[0.008129375,0.0006250747,0.0005448976,0.0004913334,0.00136537,0.001106898,0.001405862,0.002109583,0.0005695066],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001295684,"about_ca_system_score_gemma":0.001966138,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0029983,"about_ca_topic_score_gemma":0.003178384,"domain_scores_codex":[0.9986892,0.000539327,0.00005699722,0.0002368025,0.0003403059,0.0001373207],"domain_scores_gemma":[0.9964781,0.002016432,0.0004216141,0.0004131443,0.0004894939,0.0001812038],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001125128,0.00008143034,0.0004964233,0.00004349256,0.00004199445,0.00004311464,0.00003726589,0.9329308,0.001064796,0.01217372,0.001247663,0.0517268],"study_design_scores_gemma":[0.00000779591,0.00002194675,0.00004871882,0.000004365188,0.000003565268,0.000009727238,0.000002198583,0.9970605,0.000366648,0.002183271,0.0002876051,0.000003679462],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01782207,0.0003175345,0.9762512,0.000267584,0.00008872351,0.00006460396,0.00002805924,0.0006786507,0.004481612],"genre_scores_gemma":[0.7630672,0.0002686078,0.226786,0.0003032646,0.00009311245,0.0001933608,0.0001297745,0.0003489764,0.008809743],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.0029983,"threshold_uncertainty_score":0.01343811,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06320478828266483,"score_gpt":0.3209269653549211,"score_spread":0.2577221770722563,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}