{"id":"W2970168598","doi":"","title":"Surrogate Objectives for Batch Policy Optimization in One-step Decision Making","year":2019,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Computer science; Mathematical optimization; Entropy (arrow of time); Artificial intelligence; Multi-armed bandit; Constrained optimization problem; Action selection; Action (physics); Optimization problem; State (computer science); Surrogate model; Principle of maximum entropy; Machine learning; Mathematics; Algorithm; Regret; Psychology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005834687,0.001760761,0.002543097,0.0007930513,0.0004968165,0.001888516,0.001474301,0.002600129,0.003241804],"category_scores_gemma":[0.02096253,0.000791335,0.0008352044,0.0008283225,0.002241597,0.002302784,0.001918466,0.003155387,0.0006452694],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002006122,"about_ca_system_score_gemma":0.001634086,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001906809,"about_ca_topic_score_gemma":0.001472735,"domain_scores_codex":[0.998304,0.0009711368,0.00008014003,0.0002379222,0.0002476322,0.0001591724],"domain_scores_gemma":[0.98568,0.01216688,0.0007067147,0.0004798909,0.0006160293,0.0003505383],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001010306,0.00005061151,0.0003447479,0.00007337433,0.00002889852,0.00003546344,0.00003193806,0.9669447,0.0002980427,0.02239065,0.000526245,0.009174281],"study_design_scores_gemma":[0.00000471264,0.00001838946,0.00002294246,0.000009622619,0.00000228624,0.000003845102,0.000002637417,0.9923168,0.0001187892,0.007401231,0.00009593568,0.000002636558],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02374357,0.0008482864,0.9702229,0.0006846937,0.00007263917,0.00008380561,0.0001111214,0.0002806108,0.003952296],"genre_scores_gemma":[0.7832429,0.000720761,0.2097753,0.0005034396,0.0001228485,0.0004798305,0.0004079263,0.0002048085,0.004542138],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005834687,"threshold_uncertainty_score":0.03085715,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07992803755470389,"score_gpt":0.4233275306939406,"score_spread":0.3433994931392367,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}