{"id":"W2995509794","doi":"10.48550/arxiv.2002.06487","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","year":2020,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":38,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Convergence (economics); Benchmark (surveying); Computer science; Variance (accounting); Generalization error; Generalization; Artificial intelligence; Inductive bias; Machine learning; Q-learning; Algorithm; Value (mathematics); Mathematics; Stability (learning theory); Multi-task learning; Reinforcement learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01085726,0.001411334,0.002018289,0.0006558426,0.0006666941,0.001596284,0.003048555,0.001910181,0.001764259],"category_scores_gemma":[0.04126065,0.0007014133,0.0005874822,0.000857937,0.002677661,0.002801091,0.00256777,0.002766193,0.0004040864],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001461578,"about_ca_system_score_gemma":0.002630563,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002214436,"about_ca_topic_score_gemma":0.001659498,"domain_scores_codex":[0.9945462,0.00318215,0.0002421842,0.0009977765,0.0006930009,0.0003387054],"domain_scores_gemma":[0.9735221,0.01964699,0.001870462,0.002509147,0.001970185,0.0004811274],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0004054018,0.0001955934,0.004026164,0.0003115245,0.0001714693,0.00009114876,0.0002115258,0.7800384,0.003094791,0.04952687,0.002778667,0.1591484],"study_design_scores_gemma":[0.00004018464,0.00008117637,0.0001954764,0.00002247566,0.00001273029,0.00002827798,0.00001065198,0.9747987,0.001541133,0.02275782,0.0005004859,0.00001092083],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0109902,0.0002491342,0.9874084,0.000249181,0.00003691139,0.00004168388,0.00001886764,0.0003546714,0.0006510157],"genre_scores_gemma":[0.6614153,0.0002923342,0.3355082,0.0006983695,0.0001313057,0.0002720601,0.00009430219,0.0002378218,0.001350426],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01085726,"threshold_uncertainty_score":0.05741942,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09264049702283787,"score_gpt":0.1833738516716606,"score_spread":0.09073335464882272,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}