{"id":"W3132054471","doi":"10.48550/arxiv.2102.08607","title":"On the Convergence and Sample Efficiency of Variance-Reduced Policy Gradient Method","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":18,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Convexity; Truncation (statistics); Variance (accounting); Convergence (economics); Term (time); Mathematics; Variance reduction; Applied mathematics; Reinforcement learning; Mathematical optimization; Function (biology); Sample (material); Computer science; Statistics; Economics; Physics; Artificial intelligence; Monte Carlo method","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007095894,0.001262208,0.001994658,0.001087321,0.0006632314,0.001234198,0.00201699,0.001662472,0.003471499],"category_scores_gemma":[0.04499343,0.0006933106,0.0009504411,0.0005874024,0.002468071,0.00218281,0.002510266,0.003576927,0.0007734199],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00142622,"about_ca_system_score_gemma":0.002820712,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004656829,"about_ca_topic_score_gemma":0.003549427,"domain_scores_codex":[0.9971344,0.001534555,0.000112112,0.0003035983,0.000679885,0.0002354166],"domain_scores_gemma":[0.9782563,0.01802459,0.0006071403,0.00113926,0.001578719,0.000393936],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0004299908,0.0002127237,0.002198081,0.0002492272,0.0001113354,0.0001359771,0.0001599115,0.8390395,0.002686502,0.09371211,0.002612782,0.05845176],"study_design_scores_gemma":[0.000019407,0.00003833597,0.0001012083,0.00001752208,0.000007078603,0.00001389846,0.000007305587,0.9893406,0.0003801379,0.009809124,0.0002603179,0.0000051508],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0165729,0.0006256917,0.9779377,0.0005736984,0.00007144925,0.0001074636,0.00004356523,0.0004784839,0.003589054],"genre_scores_gemma":[0.5908941,0.0009052203,0.4004757,0.000668095,0.0001666117,0.0007006311,0.0003294523,0.0006008174,0.005259512],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007095894,"threshold_uncertainty_score":0.03752708,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06947985645106997,"score_gpt":0.2222800602288609,"score_spread":0.152800203777791,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}