{"id":"W2136723863","doi":"","title":"An Empirical Analysis of Off-policy Learning in Discrete MDPs","year":2012,"lang":"en","type":"article","venue":"European Workshop on Reinforcement Learning","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Reinforcement learning; Dynamic programming; Variance (accounting); Sampling (signal processing); Population; Mathematical optimization; Monte Carlo method; Policy analysis; Artificial intelligence; Algorithm; Statistics; Mathematics; Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0157547,0.0008845141,0.001216252,0.001139401,0.0006288991,0.0009969634,0.001747162,0.001598429,0.002208553],"category_scores_gemma":[0.1093269,0.0004389957,0.0006530281,0.000979577,0.002007967,0.003250869,0.001308193,0.002991931,0.0001467476],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002119482,"about_ca_system_score_gemma":0.001291752,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004121312,"about_ca_topic_score_gemma":0.002458261,"domain_scores_codex":[0.9961015,0.002500788,0.0001650387,0.0003681362,0.000607675,0.0002568655],"domain_scores_gemma":[0.8200043,0.1644182,0.005082217,0.005882434,0.003379364,0.001233424],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003829635,0.0003275411,0.01225938,0.0001773786,0.00008875811,0.00007429843,0.00008956291,0.9488671,0.0003402109,0.01752843,0.001154525,0.01870978],"study_design_scores_gemma":[0.00002647923,0.0001338433,0.002493098,0.00003348968,0.00001332447,0.00003044284,0.00003968109,0.9887648,0.0003813145,0.007846,0.0002250818,0.000012432],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8413725,0.002146841,0.150158,0.001603905,0.00007837638,0.0001948857,0.0004879375,0.0002896213,0.003668006],"genre_scores_gemma":[0.9866168,0.0003115764,0.01199765,0.00007410561,0.00002149315,0.00009380539,0.0003558908,0.0000361062,0.0004924193],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0157547,"threshold_uncertainty_score":0.08331978,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1071006399021413,"score_gpt":0.4590256981712578,"score_spread":0.3519250582691165,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}