{"id":"W3175406278","doi":"10.1109/tai.2021.3074122","title":"Optimal Policy for Bernoulli Bandits: Computation and Algorithm Gauge","year":2021,"lang":"en","type":"article","venue":"IEEE Transactions on Artificial Intelligence","topic":"Advanced Bandit Algorithms Research","field":"Decision Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Computer science; Bernoulli's principle; Algorithm; Mathematical optimization; Computation; Variety (cybernetics); Approximate Bayesian computation; Time horizon; Thompson sampling; Bayesian probability; Artificial intelligence; Mathematics; Inference","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003407305,0.0009415882,0.001325223,0.0008748752,0.0007460592,0.002141774,0.001307428,0.001522548,0.004419297],"category_scores_gemma":[0.02309803,0.0004850018,0.0005760748,0.0009737372,0.001586316,0.002223726,0.001452487,0.002168132,0.0007125963],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002564471,"about_ca_system_score_gemma":0.00499481,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007371155,"about_ca_topic_score_gemma":0.005767425,"domain_scores_codex":[0.9980795,0.0008061989,0.0001044212,0.0002988346,0.0004703081,0.000240596],"domain_scores_gemma":[0.991075,0.006815203,0.0004577198,0.0007097325,0.0006583996,0.0002839148],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002232247,0.0001164345,0.001274531,0.00009208212,0.00002840068,0.00004485106,0.00008086675,0.8605194,0.001147356,0.06359945,0.002270838,0.07060263],"study_design_scores_gemma":[0.00001575985,0.00001756572,0.00006126962,0.00001253123,0.000003886993,0.00001039265,0.000009218609,0.986084,0.0005238388,0.0129224,0.0003345778,0.000004491913],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0313411,0.000358358,0.9607878,0.0004487796,0.0000714265,0.0001061064,0.00007046616,0.0009473563,0.005868553],"genre_scores_gemma":[0.4894135,0.000381501,0.506654,0.0002964874,0.00007218124,0.0003259743,0.000263057,0.0003925274,0.002200684],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007371155,"threshold_uncertainty_score":0.01860666,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1674809196558598,"score_gpt":0.4598130319407309,"score_spread":0.2923321122848711,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}