{"id":"W2941011530","doi":"","title":"Reward Estimation for Variance Reduction in Deep Reinforcement Learning","year":2018,"lang":"en","type":"article","venue":"International Conference on Learning Representations","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"McGill University","funders":"","keywords":"Reinforcement learning; Variance reduction; Reduction (mathematics); Computer science; Variance (accounting); Estimation; Artificial intelligence; Reinforcement; Machine learning; Statistics; Econometrics; Psychology; Mathematics; Engineering; Economics; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002579187,0.0009297702,0.001519084,0.0005106871,0.0003633171,0.0009155287,0.001321208,0.001285382,0.002516943],"category_scores_gemma":[0.00972312,0.0007454579,0.0005431139,0.0004297151,0.000930149,0.001222123,0.00165639,0.002655887,0.0003722001],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001092159,"about_ca_system_score_gemma":0.001543713,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003655769,"about_ca_topic_score_gemma":0.004101951,"domain_scores_codex":[0.9991056,0.0003587145,0.00004942168,0.0001625829,0.0001993718,0.0001242075],"domain_scores_gemma":[0.9969207,0.002177949,0.0001786062,0.0001805996,0.0004316524,0.0001105591],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002384946,0.0001565002,0.0007556694,0.0001141895,0.00007437931,0.00004007059,0.00006098998,0.8548338,0.003151075,0.02010917,0.002062253,0.1184035],"study_design_scores_gemma":[0.000006696158,0.00001413658,0.00004148632,0.000004169227,0.000003370532,0.000003085329,0.000001366632,0.995622,0.0002979203,0.003932175,0.00007091211,0.000002669598],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01240243,0.0002238191,0.9860772,0.0001918595,0.00004150278,0.00003292754,0.00003308846,0.00032205,0.0006751623],"genre_scores_gemma":[0.8297433,0.000177399,0.1662936,0.0002185213,0.00007118251,0.000201044,0.0001491882,0.0001979127,0.002947831],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003655769,"threshold_uncertainty_score":0.01364017,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.050061910459264,"score_gpt":0.3514664291660533,"score_spread":0.3014045187067893,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}