{"id":"W3160261777","doi":"10.1016/j.automatica.2021.109693","title":"On the convergence of reinforcement learning with Monte Carlo Exploring Starts","year":2021,"lang":"en","type":"article","venue":"Automatica","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; European Commission; Ontario Ministry of Research, Innovation and Science; Canada Research Chairs; Government of Canada; Pacific Institute for the Mathematical Sciences","keywords":"Reinforcement learning; Mathematical optimization; Convergence (economics); Bellman equation; Monte Carlo method; Computer science; Markov decision process; Complement (music); Function (biology); Mathematics; Markov process; Artificial intelligence; Economics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01081642,0.001855887,0.003189971,0.002076894,0.001222936,0.002050062,0.003037529,0.002801899,0.006262085],"category_scores_gemma":[0.064814,0.00164503,0.001767372,0.001320513,0.005905518,0.004203607,0.005131861,0.005155704,0.0006782797],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0025205,"about_ca_system_score_gemma":0.002739299,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008811167,"about_ca_topic_score_gemma":0.004314342,"domain_scores_codex":[0.9959268,0.002670368,0.0001332504,0.0003522618,0.0005759687,0.0003414608],"domain_scores_gemma":[0.9170799,0.07612112,0.001581332,0.001438081,0.00249967,0.001279769],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0002321994,0.00005901518,0.0006578363,0.0001428269,0.00007764349,0.00004910153,0.0001668851,0.8439585,0.0003456118,0.1403226,0.001026171,0.01296165],"study_design_scores_gemma":[0.00002404787,0.00003314058,0.00006476913,0.00003079571,0.00001007205,0.00000887341,0.00001008655,0.9442423,0.00009806632,0.0552806,0.0001884953,0.00000872812],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02646715,0.001086876,0.9608256,0.0007551044,0.00009754686,0.0000826936,0.00004849933,0.0002523298,0.01038426],"genre_scores_gemma":[0.796362,0.001510008,0.1897838,0.0005095454,0.0002567123,0.0005405673,0.0002296841,0.0006951627,0.01011267],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01081642,"threshold_uncertainty_score":0.05720341,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03576915530119511,"score_gpt":0.2220393188918922,"score_spread":0.1862701635906971,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}