{"id":"W3213853783","doi":"","title":"On the Convergence and Sample Efficiency of Variance-Reduced Policy Gradient Method","year":2021,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Convexity; Truncation (statistics); Variance (accounting); Convergence (economics); Mathematics; Term (time); Variance reduction; Reinforcement learning; Applied mathematics; Mathematical optimization; Function (biology); Distribution (mathematics); Computer science; Combinatorics; Statistics; Mathematical analysis; Physics; Economics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006569208,0.001259807,0.001984282,0.001039484,0.0006455477,0.001203361,0.002010021,0.001617099,0.003689339],"category_scores_gemma":[0.0400425,0.0006743232,0.0009044567,0.0005668838,0.002364197,0.002112708,0.002406326,0.003428251,0.0007827448],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001436247,"about_ca_system_score_gemma":0.002809008,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004607949,"about_ca_topic_score_gemma":0.003530366,"domain_scores_codex":[0.9974776,0.001311446,0.00009881889,0.0002618172,0.0006246213,0.0002256949],"domain_scores_gemma":[0.9811746,0.01549925,0.0005366447,0.0009630417,0.001464838,0.0003616027],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0003941271,0.0002029466,0.001953759,0.0002420044,0.00009938946,0.0001358501,0.0001522482,0.8437232,0.002490428,0.09355958,0.002550018,0.05449659],"study_design_scores_gemma":[0.00001800085,0.00003596695,0.0000896407,0.00001677173,0.000006601417,0.00001351551,0.00000676251,0.9900734,0.0003419056,0.009145414,0.0002470357,0.000004920393],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01680058,0.0006447174,0.977291,0.0005521464,0.00007378034,0.0001091335,0.0000413527,0.0004654894,0.004021704],"genre_scores_gemma":[0.6171982,0.0009185199,0.3737909,0.0006660256,0.0001607964,0.0006963639,0.0003039798,0.0005889452,0.00567639],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006569208,"threshold_uncertainty_score":0.0347417,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05728126830244275,"score_gpt":0.2121414442744954,"score_spread":0.1548601759720526,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}