{"id":"W3209211538","doi":"10.48550/arxiv.2110.15572","title":"Understanding the Effect of Stochasticity in Policy Optimization","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Mathematical optimization; Oracle; Convergence (economics); Initialization; Stochastic optimization; Rate of convergence; Computer science; Optimization problem; Mathematics; Key (lock); Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0004083789,0.0001809334,0.0002631614,0.0003098541,0.00008568673,0.00009965897,0.001178687,0.0001564427,0.00000911425],"category_scores_gemma":[0.0002060857,0.0001669698,0.0001159066,0.0009907706,0.00009934013,0.000213206,0.001558965,0.0004739003,0.000002149085],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005559899,"about_ca_system_score_gemma":0.0002114075,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001778641,"about_ca_topic_score_gemma":0.00001454154,"domain_scores_codex":[0.9987158,0.000315587,0.0001840748,0.0004536325,0.0001116175,0.0002192848],"domain_scores_gemma":[0.9984905,0.0003757622,0.000266977,0.0007647932,0.00005645155,0.00004552189],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001038067,0.000006952774,0.002571825,0.00006548376,0.00002965615,0.00003100259,0.0003108622,0.9748871,0.000005499436,0.02206394,0.000004158967,0.00001313884],"study_design_scores_gemma":[0.0003269329,0.00007432576,0.0003210478,0.0001358242,0.00002475811,0.000001163755,0.00009337613,0.9985731,0.00008508687,0.0002245385,8.131939e-7,0.0001390217],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0150549,0.00001042242,0.9832236,0.00007037642,0.0002151963,0.0002688123,7.856854e-7,0.00005109903,0.001104774],"genre_scores_gemma":[0.9982853,0.00003342367,0.001497366,0.00002055222,0.00002403471,4.615844e-7,0.000006191365,0.000008683353,0.0001239819],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9832304,"threshold_uncertainty_score":0.6808829,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.106162173705461,"score_gpt":0.209392311833225,"score_spread":0.1032301381277639,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}