{"id":"W4382653405","doi":"10.1002/9781119873747.ch2","title":"Markov Decision Process and Reinforcement Learning","year":2023,"lang":"en","type":"other","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba","funders":"","keywords":"Markov decision process; Reinforcement learning; Computer science; Q-learning; Markov process; Key (lock); Partially observable Markov decision process; Process (computing); Mathematical optimization; Markov chain; Bellman equation; Extension (predicate logic); Machine learning; Artificial intelligence; Markov model; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001058981,0.000825711,0.0007594546,0.0006922626,0.0004083225,0.001896962,0.000787628,0.001500931,0.006979728],"category_scores_gemma":[0.003065538,0.0002314281,0.0005024162,0.001144917,0.001878362,0.00166925,0.0009919566,0.002327838,0.00109678],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00186838,"about_ca_system_score_gemma":0.001757952,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004611121,"about_ca_topic_score_gemma":0.002642051,"domain_scores_codex":[0.9991534,0.0003648416,0.00004352664,0.0001411671,0.0002265928,0.00007064634],"domain_scores_gemma":[0.9986833,0.0009502796,0.0001080484,0.00006281003,0.0001300851,0.00006539088],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0000123136,0.0000235568,0.0001940061,0.0001315748,0.00001743399,0.0000733198,0.0000551366,0.03699356,0.0001443314,0.9322,0.003371712,0.02678293],"study_design_scores_gemma":[0.00001477886,0.0000264372,0.0001938387,0.0001120584,0.00001215385,0.00007412057,0.00003812843,0.1003371,0.0001713945,0.8596867,0.03931796,0.00001530176],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":"theoretical_or_conceptual","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007484249,0.037339,0.7964808,0.008096687,0.0007911741,0.00009544942,0.0004170909,0.000325489,0.14897],"genre_scores_gemma":[0.686605,0.06293865,0.1888145,0.001909095,0.001967128,0.0004734285,0.0006590448,0.0001417652,0.05649137],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.006979728,"threshold_uncertainty_score":0.02334952,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01150965170822089,"score_gpt":0.2672792631151527,"score_spread":0.2557696114069318,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}