{"id":"W2120045945","doi":"10.1287/moor.2016.0832","title":"On the Asymptotic Optimality of Finite Approximations to Markov Decision Processes with Borel Spaces","year":2017,"lang":"en","type":"preprint","venue":"Mathematics of Operations Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Markov decision process; Mathematics; State space; Convergence (economics); Applied mathematics; Mathematical optimization; Action (physics); Markov chain; Space (punctuation); Finite state; Markov process; Class (philosophy); Q-learning; State (computer science); Average cost; Reinforcement learning; Computer science; Algorithm; Statistics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01200107,0.001640452,0.002271788,0.002339865,0.001142406,0.003032789,0.002386183,0.002178408,0.002416478],"category_scores_gemma":[0.09989255,0.001075256,0.001665893,0.001345634,0.005724216,0.005277303,0.003411328,0.005399833,0.0004615762],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.004066811,"about_ca_system_score_gemma":0.00283716,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0044772,"about_ca_topic_score_gemma":0.002845519,"domain_scores_codex":[0.9940814,0.003143956,0.0002958493,0.0007266937,0.001284133,0.0004678692],"domain_scores_gemma":[0.8984431,0.09275208,0.002816962,0.002716684,0.002379298,0.0008919176],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001216101,0.00008116553,0.001351467,0.0001831006,0.00008209339,0.00009271746,0.0002020197,0.7005761,0.0008023205,0.2825922,0.0005926023,0.01332263],"study_design_scores_gemma":[0.000008217061,0.00003080506,0.0001245205,0.00003870112,0.000007457812,0.00001612549,0.00001744912,0.8959663,0.0003265594,0.1032382,0.0002165136,0.000009009146],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04024952,0.001175655,0.9530747,0.0007299379,0.00006513998,0.0000537685,0.00008139136,0.0002193319,0.004350571],"genre_scores_gemma":[0.8024585,0.002283327,0.189924,0.0003981588,0.0002101928,0.0004135812,0.0004898272,0.0003506903,0.003471743],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01200107,"threshold_uncertainty_score":0.06346846,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1148588961374406,"score_gpt":0.3944555419249472,"score_spread":0.2795966457875066,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}