{"id":"W7124275932","doi":"10.65109/dxvr3975","title":"Forward Actor-Critic for Nonlinear Function Approximation in Reinforcement Learning","year":2017,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Function approximation; Nonlinear system; Function (biology); Class (philosophy); Q-learning; Control theory (sociology)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","sts","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.001951365,0.0005077621,0.0005393152,0.0003838396,0.001795656,0.002511716,0.001813393,0.0003267695,0.000179961],"category_scores_gemma":[0.001825602,0.0005418609,0.0002255873,0.0002225909,0.0001773673,0.003326222,0.00085691,0.0007131349,0.0002136268],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0004046641,"about_ca_system_score_gemma":0.0002785109,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00009997684,"about_ca_topic_score_gemma":0.00002891308,"domain_scores_codex":[0.9956833,0.0001262541,0.001249603,0.0009512988,0.0008820865,0.001107447],"domain_scores_gemma":[0.9961891,0.0002740114,0.00106894,0.001815417,0.0004369814,0.0002156111],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001342943,0.00005886154,0.002235272,0.000399479,0.00005713175,0.000003203508,0.0008809853,0.9453523,0.0002564789,0.02292391,0.0001922796,0.02750587],"study_design_scores_gemma":[0.002401976,0.001512328,0.002472022,0.0003164365,0.00005679452,0.000002957339,0.0001772682,0.9798232,0.0006263904,0.0004715653,0.01154403,0.0005950001],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.001888096,0.00003702443,0.979401,0.001063962,0.002494456,0.002359064,0.000001029008,0.000151708,0.01260365],"genre_scores_gemma":[0.9284223,0.00007836046,0.05122981,0.0002584782,0.000461966,0.0002036318,0.00005631902,0.00005305648,0.01923613],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9281712,"threshold_uncertainty_score":0.9997033,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03471304745053352,"score_gpt":0.2929229350638085,"score_spread":0.258209887613275,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}