{"id":"W2081102656","doi":"10.1007/s00186-013-0432-y","title":"Accelerated modified policy iteration algorithms for Markov decision processes","year":2013,"lang":"en","type":"article","venue":"Mathematical Methods of Operations Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Markov decision process; Convergence (economics); Markov chain; Operator (biology); Mathematical optimization; Computer science; Markov process; Algorithm; Markov model; Partially observable Markov decision process; Mathematics; Machine learning; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003059841,0.001199762,0.001964431,0.0009530113,0.0006172598,0.001356921,0.002182053,0.001908071,0.004818671],"category_scores_gemma":[0.01414442,0.001124874,0.0008908933,0.0008012196,0.001726407,0.002004999,0.002229806,0.003068274,0.0007200667],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001755634,"about_ca_system_score_gemma":0.00303107,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005611167,"about_ca_topic_score_gemma":0.004629883,"domain_scores_codex":[0.9985541,0.0007613783,0.00006892016,0.0001617067,0.0003230649,0.0001309123],"domain_scores_gemma":[0.9910773,0.00704517,0.0004311645,0.0003849308,0.0008085881,0.0002528536],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001081847,0.00005985412,0.0002623534,0.0000662176,0.00003950291,0.00003166221,0.00005498859,0.9143505,0.0004039165,0.05812671,0.000925759,0.02557033],"study_design_scores_gemma":[0.00001391378,0.00001092267,0.00002079382,0.000004406317,0.00000263976,0.000003605992,0.000001732575,0.9852663,0.00007529038,0.01441442,0.000182551,0.000003476],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01102688,0.0002834926,0.986426,0.0001960745,0.00009327294,0.00004528927,0.00002982845,0.0001609687,0.001738231],"genre_scores_gemma":[0.5207879,0.000606539,0.4669978,0.0002488944,0.0002265649,0.0006921596,0.0002169138,0.0002802026,0.009943084],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005611167,"threshold_uncertainty_score":0.01618212,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2714919902690478,"score_gpt":0.5351392337457531,"score_spread":0.2636472434767053,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}