{"id":"W2963923407","doi":"","title":"Addressing Function Approximation Error in Actor-Critic Methods","year":2018,"lang":"en","type":"article","venue":"UvA-DARE (University of Amsterdam)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":414,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Computer science; Bellman equation; Suite; Function (biology); Function approximation; Value (mathematics); Limit (mathematics); Artificial intelligence; Approximation algorithm; Temporal difference learning; Mathematical optimization; Machine learning; Algorithm; Artificial neural network; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006675546,0.002048607,0.002305738,0.0006133356,0.0006164487,0.001655963,0.002410543,0.002584413,0.002206057],"category_scores_gemma":[0.02189939,0.0009211313,0.0004926783,0.0005594149,0.002085866,0.002039509,0.002371957,0.003756252,0.0006170324],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001360861,"about_ca_system_score_gemma":0.001935544,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003352937,"about_ca_topic_score_gemma":0.002667639,"domain_scores_codex":[0.9979382,0.0009318911,0.0001155553,0.0003452617,0.0004675464,0.0002015298],"domain_scores_gemma":[0.9891884,0.007904612,0.0006460999,0.0006588059,0.001316234,0.0002859781],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001642384,0.00005795956,0.0009682485,0.0001208867,0.00007296595,0.00008064903,0.00009485982,0.9358764,0.00125958,0.01582992,0.001339221,0.04413511],"study_design_scores_gemma":[0.00001365047,0.00002325637,0.00003899366,0.00001186063,0.000006012386,0.00001257516,0.00000511307,0.9926397,0.0004879768,0.00650691,0.0002494765,0.000004561523],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009835275,0.0004761258,0.9874355,0.000329293,0.00007493994,0.00003285941,0.00001604113,0.0004327084,0.001367391],"genre_scores_gemma":[0.8020002,0.0003641539,0.1925849,0.0004275609,0.0001101016,0.0002075921,0.00007741661,0.0002744173,0.003953543],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006675546,"threshold_uncertainty_score":0.03530407,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07700182874909071,"score_gpt":0.3215285431639732,"score_spread":0.2445267144148824,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}