{"id":"W2135829225","doi":"10.1109/gamenets.2009.5137416","title":"Online learning in Markov decision processes with arbitrarily changing rewards and transitions","year":2009,"lang":"en","type":"article","venue":"","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":37,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Markov decision process; Regret; Computer science; Markov chain; Transition (genetics); Decision maker; Markov process; Range (aeronautics); Trajectory; Control (management); Online learning; Mathematical optimization; Artificial intelligence; Machine learning; Mathematics; Operations research; Statistics; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005256236,0.00149611,0.002239828,0.0007441349,0.0008591863,0.002075865,0.001943744,0.002452667,0.001896577],"category_scores_gemma":[0.01948992,0.0009187549,0.001016281,0.001265351,0.0027229,0.003233079,0.002601748,0.002935517,0.0002780464],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002115194,"about_ca_system_score_gemma":0.001916098,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006427636,"about_ca_topic_score_gemma":0.00402363,"domain_scores_codex":[0.9975031,0.001155098,0.0001109674,0.0005600703,0.0002716722,0.0003991389],"domain_scores_gemma":[0.979482,0.01782464,0.001353912,0.000511584,0.000426832,0.0004010142],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.0001563925,0.00006552084,0.0005663609,0.00006985647,0.00004533227,0.0001006544,0.00006706944,0.9406334,0.0002752533,0.04501916,0.0002916052,0.0127094],"study_design_scores_gemma":[0.00001871125,0.00002173302,0.00005674295,0.000007401469,0.000008029638,0.00001010939,0.000005425254,0.9697318,0.0001748661,0.02985314,0.0001061305,0.000005921248],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04028909,0.0007114891,0.9562605,0.000636676,0.00004194318,0.00005477533,0.00005599845,0.0002303296,0.001719193],"genre_scores_gemma":[0.8895679,0.0008772737,0.106114,0.0002380586,0.0001113609,0.0002192478,0.0001317565,0.00005584404,0.00268447],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006427636,"threshold_uncertainty_score":0.02779794,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04799188361605175,"score_gpt":0.3932287474444243,"score_spread":0.3452368638283726,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}