{"id":"W2963313316","doi":"","title":"Scalable trust-region method for deep reinforcement learning using Kronecker-factored approximation","year":2017,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":92,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Kronecker delta; Reinforcement learning; Scalability; Computer science; Trust region; Curvature; Mathematical optimization; Artificial intelligence; Theoretical computer science; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001628899,0.001177549,0.00143103,0.0004756112,0.0003162548,0.000889598,0.001461519,0.001307144,0.003410135],"category_scores_gemma":[0.00479552,0.0005657082,0.0007660139,0.0003927632,0.001125491,0.001361799,0.001221726,0.002232142,0.0009275754],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001507571,"about_ca_system_score_gemma":0.001727517,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006236748,"about_ca_topic_score_gemma":0.004733259,"domain_scores_codex":[0.9994174,0.0001935007,0.00003163057,0.0001267074,0.0001654074,0.00006543072],"domain_scores_gemma":[0.9985531,0.0007389919,0.0001284989,0.0001646719,0.000319976,0.0000948447],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009053696,0.00003326704,0.0003406002,0.00005352742,0.0000369873,0.00005488846,0.00004447921,0.9456026,0.002122253,0.01207195,0.001358944,0.03818994],"study_design_scores_gemma":[0.000003501562,0.000009075788,0.00001174852,0.00000196218,0.00000154009,0.000004154212,0.000001163436,0.9980832,0.0002339906,0.001488424,0.0001593773,0.000001851574],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003209925,0.0001148044,0.9954531,0.00006285336,0.00002441818,0.00001922329,0.00001642285,0.0004716881,0.0006275103],"genre_scores_gemma":[0.6120471,0.0002544567,0.3808682,0.0002122441,0.00006415586,0.0002404913,0.0002084068,0.0005440684,0.005560957],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006236748,"threshold_uncertainty_score":0.01240093,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05248858218001681,"score_gpt":0.315826014867957,"score_spread":0.2633374326879402,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}