{"id":"W3136541527","doi":"10.1287/moor.2022.1331","title":"Convergence of Finite Memory Q Learning for POMDPs and Near Optimality of Learned Policies Under Filter Stability","year":2022,"lang":"en","type":"article","venue":"Mathematics of Operations Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Markov decision process; Partially observable Markov decision process; Convergence (economics); Bellman equation; Mathematical optimization; Mathematics; Limit (mathematics); Stability (learning theory); Filter (signal processing); Q-learning; Reinforcement learning; Optimal control; Ergodicity; Markov chain; Applied mathematics; Computer science; Markov process; Artificial intelligence; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007389967,0.0009997521,0.001413291,0.001098466,0.0009813897,0.001761536,0.001500328,0.001964967,0.00246835],"category_scores_gemma":[0.0530324,0.0006681955,0.001082767,0.0005611256,0.003806336,0.003574217,0.002793384,0.002653154,0.0003346881],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002279695,"about_ca_system_score_gemma":0.002785705,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004182089,"about_ca_topic_score_gemma":0.001936018,"domain_scores_codex":[0.9976433,0.000930607,0.0001446964,0.0004788819,0.0005473589,0.0002551225],"domain_scores_gemma":[0.9588679,0.03553162,0.001982301,0.00107942,0.001918592,0.0006201605],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000176243,0.0001000935,0.001848971,0.0001523287,0.000069113,0.0001352577,0.0003092179,0.8399283,0.002057243,0.1370775,0.0004172377,0.01772861],"study_design_scores_gemma":[0.00001507612,0.00004978177,0.0001127925,0.00001647108,0.000004837877,0.00001495467,0.00001621229,0.964435,0.0006584717,0.03455866,0.0001100325,0.000007571288],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03305541,0.0001579362,0.964425,0.0002899167,0.00001760148,0.00005422784,0.00003205114,0.0001520992,0.00181573],"genre_scores_gemma":[0.8718561,0.0003463072,0.1245505,0.0002469449,0.00004490515,0.0003996936,0.0001318221,0.0001508896,0.002272924],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007389967,"threshold_uncertainty_score":0.03908235,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1956737594459966,"score_gpt":0.3990674966197256,"score_spread":0.2033937371737291,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}