{"id":"W2807787719","doi":"10.65109/mhju3374","title":"Leveraging Observational Learning for Exploration in Bandits","year":2018,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Reinforcement learning; Imitation; Observational learning; Observational study; Function (biology); Artificial intelligence; Multi-agent system; Intelligent agent; Machine learning; Cloning (programming); Psychology; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003119211,0.00005723472,0.00005823082,0.00008506559,0.0001173253,0.000112263,0.0002381464,0.0000259503,0.0000261968],"category_scores_gemma":[0.0001675708,0.00005667331,0.0000178365,0.0002205449,0.00001514113,0.0008982405,0.00006914352,0.00006845623,0.00005239716],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003869198,"about_ca_system_score_gemma":0.00003793326,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000006945236,"about_ca_topic_score_gemma":0.000003724682,"domain_scores_codex":[0.9993336,0.00002405642,0.0001588122,0.0001711618,0.0001524068,0.000160008],"domain_scores_gemma":[0.9995775,0.0001165825,0.00005269386,0.0001250257,0.0001067048,0.00002150052],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000003791095,0.000006795259,0.01025544,0.000006040423,0.000003276081,4.340563e-7,0.001551911,0.9196689,0.0002561412,0.06271223,0.0007868138,0.004748294],"study_design_scores_gemma":[0.0002371285,0.00008242823,0.007093718,0.00001060962,5.487777e-7,5.03092e-7,0.00004543056,0.9815735,0.0007434201,0.001659387,0.008475518,0.00007781368],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005596985,0.000002363873,0.9895014,0.000898402,0.0002418127,0.0001233621,2.271789e-8,0.0001032989,0.003532384],"genre_scores_gemma":[0.8405737,0.000001322825,0.1560971,0.0003358016,0.0001266887,0.00002023357,0.000007201327,0.000005092038,0.002832891],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8349767,"threshold_uncertainty_score":0.231107,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1307781873236767,"score_gpt":0.3125012498775136,"score_spread":0.1817230625538369,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}