{"id":"W4386815360","doi":"10.14428/esann/2023.es2023-181","title":"Multi-Fidelity Reinforcement Learning with Control Variates","year":2023,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Microsoft (Canada)","funders":"","keywords":"Reinforcement learning; Estimator; Fidelity; Control variates; Computer science; Variance (accounting); Variance reduction; High fidelity; Monte Carlo method; Mathematical optimization; Bellman equation; Artificial intelligence; Sample (material); Function (biology); Machine learning; Mathematics; Statistics; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003771323,0.0009484338,0.001097824,0.0004180719,0.0004057766,0.001033932,0.001463947,0.001307264,0.001336281],"category_scores_gemma":[0.0137079,0.0006129228,0.0004861444,0.0003134222,0.001556091,0.001944878,0.002105629,0.002037846,0.0001873623],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001057811,"about_ca_system_score_gemma":0.000826066,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00302129,"about_ca_topic_score_gemma":0.002345674,"domain_scores_codex":[0.9984169,0.0006889916,0.00007330183,0.0002718739,0.0004114471,0.0001374416],"domain_scores_gemma":[0.993683,0.004309967,0.0008063125,0.0004832904,0.0004654147,0.0002520818],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009155978,0.00005950141,0.00101482,0.00003164789,0.00003058874,0.00004605918,0.00004450453,0.9782416,0.00124096,0.006766362,0.0001264354,0.01230593],"study_design_scores_gemma":[0.000008373139,0.00003375412,0.00007308683,0.000002907353,0.000002305466,0.000007153407,0.000001996383,0.9979542,0.0003402343,0.001492993,0.0000794651,0.000003451504],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04154731,0.0002094577,0.9567348,0.0002775308,0.00003247987,0.0000485759,0.00001706302,0.0002451299,0.0008875406],"genre_scores_gemma":[0.926284,0.00006366334,0.07237108,0.0001429394,0.00003062996,0.00007874062,0.00003224056,0.00003336069,0.0009633182],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003771323,"threshold_uncertainty_score":0.01994491,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02119730371790796,"score_gpt":0.2544386487722293,"score_spread":0.2332413450543214,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}