{"id":"W2000850397","doi":"10.1109/tac.2013.2292137","title":"Online Markov Decision Processes Under Bandit Feedback","year":2014,"lang":"en","type":"article","venue":"IEEE Transactions on Automatic Control","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":102,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Regret; Hindsight bias; Markov decision process; Markov chain; State (computer science); Computer science; Markov process; Function (biology); Mathematical economics; Discrete mathematics; Combinatorics; Mathematical optimization; Mathematics; Artificial intelligence; Algorithm; Machine learning; Statistics; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004397803,0.00190747,0.00277837,0.0008937691,0.001040906,0.002715235,0.001928173,0.003183634,0.004407706],"category_scores_gemma":[0.01779657,0.001039889,0.0009970801,0.001320215,0.002756916,0.003490251,0.002438064,0.003358298,0.0008395383],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003941219,"about_ca_system_score_gemma":0.002285632,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01091907,"about_ca_topic_score_gemma":0.006695867,"domain_scores_codex":[0.9967272,0.001263439,0.000118306,0.0006525886,0.0004548281,0.0007835754],"domain_scores_gemma":[0.982404,0.01397566,0.001636015,0.0005467908,0.0007030012,0.0007345224],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003541121,0.0001027392,0.0008616457,0.0001098055,0.00005170634,0.0002383124,0.0001082417,0.8623846,0.0003596117,0.1268949,0.001400076,0.007134311],"study_design_scores_gemma":[0.00003176618,0.00002254175,0.00008265184,0.000008102666,0.000007741083,0.00001402501,0.00000776558,0.9598926,0.00008974151,0.0396424,0.0001924286,0.000008260498],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1228584,0.002057088,0.8580876,0.003381191,0.0002157423,0.0001473744,0.0006287743,0.0009229982,0.01170077],"genre_scores_gemma":[0.9591931,0.0009523226,0.02889504,0.00040305,0.0002016841,0.0002656374,0.00031108,0.00009605486,0.009681872],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01091907,"threshold_uncertainty_score":0.02859569,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04329478899436651,"score_gpt":0.3667983632348631,"score_spread":0.3235035742404966,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}