{"id":"W2950527138","doi":"10.48550/arxiv.math/0506489","title":"Acceleration Operators in the Value Iteration Algorithms for Markov Decision Processes","year":2005,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Markov decision process; Monotone polygon; Convergence (economics); Mathematical optimization; Algorithm; Markov chain; Operator (biology); Mathematics; Acceleration; Contraction (grammar); Dynamic programming; Computer science; Markov process; Applied mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003569596,0.001120124,0.0009920374,0.0005705669,0.0004731687,0.00100589,0.001240911,0.001241267,0.00227051],"category_scores_gemma":[0.01163833,0.0004752799,0.0009416582,0.0007173872,0.0021565,0.00201266,0.001958305,0.002802035,0.0004718277],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007216883,"about_ca_system_score_gemma":0.001316728,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009768584,"about_ca_topic_score_gemma":0.0006511053,"domain_scores_codex":[0.9987343,0.0006646079,0.00005251548,0.0001439203,0.0003019504,0.0001027941],"domain_scores_gemma":[0.9954785,0.003605688,0.0002320471,0.0002202518,0.0003261558,0.0001375103],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001407023,0.000112094,0.0005945765,0.0002076766,0.00005150641,0.0001006806,0.0002739919,0.4067431,0.003902561,0.5058636,0.001441234,0.08056834],"study_design_scores_gemma":[0.0000171456,0.00006072033,0.00003577802,0.00001655587,0.000005953768,0.00002466371,0.000008377171,0.9099413,0.0009206518,0.08793065,0.001029617,0.000008617537],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007219844,0.0002228447,0.9909576,0.0001441785,0.00004832904,0.00003270949,0.000005935988,0.00006740525,0.001301167],"genre_scores_gemma":[0.3830844,0.0009864902,0.6100066,0.0002179441,0.0001994983,0.0004167137,0.00005193763,0.0001449131,0.004891465],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.003569596,"threshold_uncertainty_score":0.0188781,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06572374678319638,"score_gpt":0.325058715766949,"score_spread":0.2593349689837526,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}