{"id":"W4385890042","doi":"10.48550/arxiv.2308.07591","title":"Approximations and Learning for Continuous State and Action MDPs under Average Cost Criteria","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Mathematics; Markov decision process; Discretization; Ergodicity; Mathematical optimization; Applied mathematics; Convergence (economics); Markov process; Computer science; Mathematical analysis","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003393381,0.000216548,0.0002421807,0.0002306963,0.0003659081,0.0003834116,0.0003946914,0.0001508942,0.00000683991],"category_scores_gemma":[0.00009482027,0.0002669859,0.00006194524,0.000218335,0.00009059488,0.0004080007,0.001087912,0.0005166014,0.00002054546],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001038466,"about_ca_system_score_gemma":0.00006331969,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000534124,"about_ca_topic_score_gemma":0.00001507796,"domain_scores_codex":[0.9986457,0.0001265345,0.000172128,0.0007080259,0.00006938222,0.0002782298],"domain_scores_gemma":[0.9988186,0.000310179,0.0002410658,0.0003926707,0.0001292825,0.0001081815],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001328412,0.000008119237,0.0008020964,0.0001301598,0.00005406644,0.00001484815,0.0004525595,0.9828573,0.00004052317,0.01484696,0.0001161631,0.0006639106],"study_design_scores_gemma":[0.0004672424,0.00006197443,0.002427512,0.0000656309,0.00003748628,0.000003547727,0.0001862459,0.9866371,0.00002444039,0.009093517,0.0007212873,0.000274082],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.07766631,0.00001181704,0.9207278,0.000121231,0.0003974777,0.0005383929,0.000006461507,0.0002453154,0.0002852265],"genre_scores_gemma":[0.9812738,0.0002643009,0.005341294,0.00004566389,0.00003333943,0.000004584344,0.00003699449,0.0000246065,0.01297537],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9153865,"threshold_uncertainty_score":0.9999782,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1385473571740192,"score_gpt":0.2429579445238171,"score_spread":0.104410587349798,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}