{"id":"W2963437270","doi":"","title":"Per-decision Multi-step Temporal Difference Learning with Control Variates.","year":2018,"lang":"en","type":"article","venue":"Uncertainty in Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; University of British Columbia","funders":"","keywords":"Control variates; Temporal difference learning; Reinforcement learning; Variance (accounting); Computer science; Control (management); Variance reduction; Monte Carlo method; Artificial intelligence; Machine learning; Statistics; Mathematics; Hybrid Monte Carlo; Bayesian probability; Markov chain Monte Carlo","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003154112,0.0008672708,0.001187087,0.0003521859,0.0003894872,0.001001372,0.002029981,0.001520178,0.003852058],"category_scores_gemma":[0.01196722,0.0004273488,0.0005111022,0.000434234,0.001222565,0.001681435,0.001663144,0.002394638,0.0005230919],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009492963,"about_ca_system_score_gemma":0.001642459,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002833761,"about_ca_topic_score_gemma":0.002731928,"domain_scores_codex":[0.9990398,0.000354413,0.00006389794,0.0001917184,0.0002497193,0.0001003037],"domain_scores_gemma":[0.9945697,0.003975049,0.000328714,0.0004161902,0.0004405694,0.0002696925],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0005693145,0.0002901345,0.001371624,0.0001654119,0.00008388401,0.00008796369,0.00008131689,0.848229,0.001765087,0.02162638,0.001368462,0.1243614],"study_design_scores_gemma":[0.00001291764,0.00004162999,0.00004136499,0.000004391926,0.000003931925,0.000009207711,0.000001963711,0.9969494,0.0004561492,0.00225368,0.0002215333,0.000003865067],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0150369,0.0004085802,0.9818672,0.0002004279,0.0001219127,0.00008404034,0.00003525648,0.0004402206,0.001805525],"genre_scores_gemma":[0.8143498,0.0001428201,0.1825303,0.0002726714,0.00006013165,0.0001909391,0.0001151771,0.00007669919,0.002261473],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003852058,"threshold_uncertainty_score":0.01668078,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04175902341515242,"score_gpt":0.2973694407687176,"score_spread":0.2556104173535652,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}