{"id":"W3169514089","doi":"","title":"EMaQ: Expected-Max Q-Learning Operator for Simple Yet Effective Offline and Online RL","year":2021,"lang":"en","type":"article","venue":"International Conference on Machine Learning","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":true,"ca_institutions":"Google (Canada); University of Alberta; University of Toronto","funders":"","keywords":"Reinforcement learning; Computer science; Backup; Heuristic; Operator (biology); Online and offline; Offline learning; Simple (philosophy); Artificial intelligence; Generative grammar; Machine learning; Mathematical optimization; Theoretical computer science; Online learning; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00519968,0.001784533,0.001647938,0.0006282674,0.0006117325,0.001588781,0.004013773,0.00255204,0.01185209],"category_scores_gemma":[0.01789861,0.0006401663,0.0008578414,0.0007644854,0.00212092,0.002434457,0.004369552,0.004751676,0.002920569],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001341384,"about_ca_system_score_gemma":0.002941414,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002713011,"about_ca_topic_score_gemma":0.002770605,"domain_scores_codex":[0.9972796,0.001078184,0.0001622859,0.0005566647,0.0006657904,0.000257505],"domain_scores_gemma":[0.9943389,0.00382862,0.0002916221,0.0006943003,0.0005669346,0.0002796095],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004390183,0.0002848199,0.0009984175,0.0003378948,0.00005927193,0.0001536268,0.0002366032,0.5414227,0.002920643,0.1123015,0.01171898,0.3291266],"study_design_scores_gemma":[0.00003057528,0.00005913452,0.00004363084,0.00001592364,0.000003887955,0.00002810892,0.00001226916,0.9673505,0.00069554,0.0302862,0.001466506,0.000007798892],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.00203276,0.0001100713,0.9949514,0.0002073676,0.00004496626,0.00007740357,0.00004327358,0.0009606149,0.001572205],"genre_scores_gemma":[0.267275,0.0002583769,0.7238627,0.0007274397,0.0001481128,0.0006653057,0.0003626652,0.0007105201,0.005989853],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01185209,"threshold_uncertainty_score":0.03964919,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02841059612818234,"score_gpt":0.3196032698915692,"score_spread":0.2911926737633869,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}