{"id":"W3158744994","doi":"","title":"Adaptive Approximate Policy Iteration","year":2021,"lang":"en","type":"article","venue":"International Conference on Artificial Intelligence and Statistics","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Regret; Reinforcement learning; Markov decision process; Computer science; Ergodic theory; Tilde; Q-learning; Bellman equation; Mathematical optimization; Novelty; Function (biology); Upper and lower bounds; Function approximation; Scheme (mathematics); Adaptive learning; Online learning; Markov process; Artificial intelligence; Mathematics; Machine learning; Discrete mathematics; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001922425,0.000904548,0.001506394,0.0005628992,0.0004549218,0.001148411,0.001753279,0.001283845,0.002809315],"category_scores_gemma":[0.00905413,0.0005088448,0.0005976161,0.0006327258,0.001288653,0.001312266,0.001775677,0.001771155,0.0005629229],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001199381,"about_ca_system_score_gemma":0.002101873,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003168662,"about_ca_topic_score_gemma":0.002414139,"domain_scores_codex":[0.9986993,0.0004638294,0.00006313414,0.000231694,0.0003905113,0.00015155],"domain_scores_gemma":[0.9966659,0.002115877,0.0002580986,0.0003858552,0.0004205177,0.0001538361],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001325354,0.00006823459,0.0005937805,0.00006704206,0.00003838979,0.00005187955,0.0000657777,0.9002399,0.0007992376,0.0366219,0.001275779,0.06004553],"study_design_scores_gemma":[0.000007135287,0.0000158301,0.00002152116,0.000003872713,0.000002325817,0.000009556359,0.000002328129,0.9938167,0.0002159524,0.005627007,0.0002753127,0.000002422373],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01019774,0.0002161005,0.9856376,0.0001479768,0.00005007291,0.00004971021,0.00002918605,0.0004365245,0.003235134],"genre_scores_gemma":[0.7129414,0.0002464915,0.2813378,0.0002316756,0.00007539516,0.0003180233,0.0001497414,0.0001416988,0.004557762],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003168662,"threshold_uncertainty_score":0.01016688,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1202154481482684,"score_gpt":0.3511960815700123,"score_spread":0.2309806334217439,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}