{"id":"W7124275932","doi":"10.65109/dxvr3975","title":"Forward Actor-Critic for Nonlinear Function Approximation in Reinforcement Learning","year":2017,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Function approximation; Nonlinear system; Function (biology); Class (philosophy); Q-learning; Control theory (sociology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002076293,0.001294094,0.001158006,0.0004176819,0.0003848333,0.0008595822,0.001349475,0.001459903,0.003071727],"category_scores_gemma":[0.005313465,0.0006262467,0.0006331903,0.000451287,0.001338941,0.0008888181,0.001038997,0.002707453,0.000701397],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001113022,"about_ca_system_score_gemma":0.001250332,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004950238,"about_ca_topic_score_gemma":0.004960948,"domain_scores_codex":[0.9994195,0.000220278,0.0000310764,0.0001170369,0.000162718,0.00004944079],"domain_scores_gemma":[0.9981828,0.001250113,0.0001131497,0.000142691,0.0002537757,0.00005752649],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00005248301,0.00003191968,0.0003257478,0.00009803284,0.00004042509,0.00007001235,0.00005273055,0.9315288,0.001171017,0.02880001,0.001164936,0.03666383],"study_design_scores_gemma":[0.000005020199,0.000008881438,0.0000180359,0.000004204081,0.000003032528,0.000005804221,0.000001213648,0.995428,0.0002068569,0.003967514,0.0003486121,0.000002739865],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.002881867,0.0003838767,0.9942247,0.000137497,0.00005123269,0.00003039301,0.00001675512,0.0002939027,0.001979779],"genre_scores_gemma":[0.6641686,0.0007935123,0.3225313,0.000295018,0.0001045484,0.0003783774,0.0001155864,0.0002065942,0.01140648],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004950238,"threshold_uncertainty_score":0.01098067,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03471304745053352,"score_gpt":0.2929229350638085,"score_spread":0.258209887613275,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}