{"id":"W4399828205","doi":"10.1007/978-3-031-54071-4_21","title":"Reinforcement Learning for Fully Observable Models: Convergence to Near Optimality under Weak Feller Continuity","year":2024,"lang":"en","type":"book-chapter","venue":"Systems & control","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Queen's University","funders":"","keywords":"Observable; Reinforcement learning; Convergence (economics); Reinforcement; Computer science; Mathematics; Mathematical optimization; Artificial intelligence; Psychology; Economics; Physics; Social psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004561224,0.001828706,0.003082454,0.001046138,0.0009120335,0.002437494,0.002150138,0.002727668,0.005001202],"category_scores_gemma":[0.02395952,0.001220612,0.001708366,0.0009061344,0.004403607,0.004883797,0.004289562,0.005729779,0.0006440869],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002512015,"about_ca_system_score_gemma":0.00218719,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00463012,"about_ca_topic_score_gemma":0.002455161,"domain_scores_codex":[0.9982039,0.0008961773,0.0000911977,0.0002922378,0.0003603106,0.0001561997],"domain_scores_gemma":[0.9851724,0.01283876,0.0005790466,0.0004535783,0.0005762326,0.0003798857],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001360272,0.0000926057,0.0003573854,0.0002771676,0.00008522796,0.0001053895,0.000279341,0.3324571,0.001408531,0.6411945,0.00229219,0.02131445],"study_design_scores_gemma":[0.00001317835,0.00003461618,0.00004421279,0.00002059433,0.000007470462,0.00001609713,0.00001298162,0.6498581,0.0001458206,0.3495586,0.0002785044,0.000009810489],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02408278,0.001051364,0.961117,0.001021339,0.00008999233,0.00005128303,0.0001063533,0.0002642838,0.0122156],"genre_scores_gemma":[0.8227438,0.001901533,0.1564409,0.0006206786,0.0002273905,0.0004068833,0.0003627098,0.000326494,0.01696957],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005001202,"threshold_uncertainty_score":0.02412236,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04009775781671515,"score_gpt":0.2557781574063045,"score_spread":0.2156803995895893,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}