{"id":"W4399284119","doi":"10.1016/j.neucom.2024.127963","title":"Multi-fidelity reinforcement learning with control variates","year":2024,"lang":"en","type":"article","venue":"Neurocomputing","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":false,"ca_institutions":"Microsoft (Canada)","funders":"Argonne National Laboratory; Office of Science; Laboratory Computing Resource Center; Advanced Scientific Computing Research; U.S. Department of Energy","keywords":"Reinforcement learning; Variance reduction; Estimator; Fidelity; Control variates; Computer science; Variance (accounting); High fidelity; Mathematical optimization; Reduction (mathematics); Function (biology); Artificial intelligence; Machine learning; Monte Carlo method; Mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002963822,0.0009121451,0.001016503,0.0004854912,0.0003993351,0.0008965536,0.001325463,0.001837628,0.003059341],"category_scores_gemma":[0.008792929,0.0006098935,0.000529113,0.0004269028,0.001300082,0.00147936,0.002441973,0.002028057,0.0002956525],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007625231,"about_ca_system_score_gemma":0.0006987506,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00261685,"about_ca_topic_score_gemma":0.002348041,"domain_scores_codex":[0.9988637,0.0004716702,0.00006397361,0.0001853076,0.0002900906,0.0001253061],"domain_scores_gemma":[0.9960124,0.002765437,0.0003544539,0.0002828365,0.0004314755,0.0001533574],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000117714,0.00006538557,0.0004126765,0.00005325293,0.00003665448,0.00005060895,0.00003389999,0.9675277,0.001085148,0.008017759,0.0003130284,0.02228607],"study_design_scores_gemma":[0.00001080493,0.00003560667,0.00005516263,0.00000461979,0.000004155446,0.00001076915,0.000001694357,0.9978991,0.0002772065,0.00159893,0.00009832414,0.000003530871],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02466194,0.0002065266,0.972298,0.0002386804,0.00005672823,0.00005099859,0.00002325007,0.0002250835,0.002238742],"genre_scores_gemma":[0.9389747,0.0000798402,0.05819871,0.0001125137,0.00003546734,0.0001346445,0.00003079608,0.00004055012,0.002392753],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003059341,"threshold_uncertainty_score":0.01567441,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01498700950666781,"score_gpt":0.2492363708707679,"score_spread":0.2342493613641001,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}