{"id":"W2807787719","doi":"10.65109/mhju3374","title":"Leveraging Observational Learning for Exploration in Bandits","year":2018,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Reinforcement learning; Imitation; Observational learning; Observational study; Function (biology); Artificial intelligence; Multi-agent system; Intelligent agent; Machine learning; Cloning (programming); Psychology; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004285163,0.001606095,0.002484645,0.0008236565,0.0008061773,0.002273983,0.002589757,0.002511403,0.003256129],"category_scores_gemma":[0.02700026,0.0008402634,0.0008715991,0.0007917439,0.003136735,0.00359405,0.003689825,0.002774672,0.0005857582],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001336237,"about_ca_system_score_gemma":0.001420138,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002766235,"about_ca_topic_score_gemma":0.002569484,"domain_scores_codex":[0.9977532,0.001128833,0.0001300551,0.0003696895,0.0003644429,0.000253833],"domain_scores_gemma":[0.9849133,0.01152854,0.001490175,0.001135307,0.0004878704,0.0004448974],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001898097,0.0001112971,0.0018984,0.0001667885,0.00008749571,0.0001651383,0.0001857621,0.8469006,0.001261247,0.119854,0.0006465191,0.02853296],"study_design_scores_gemma":[0.00001636232,0.00003397155,0.00008683664,0.00001526064,0.000008167974,0.00001585581,0.000008205544,0.9477517,0.0001424097,0.05170505,0.0002082417,0.000007879688],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03227261,0.0007059689,0.9631116,0.0005413322,0.0000507894,0.00005476988,0.00006558836,0.0004198053,0.002777578],"genre_scores_gemma":[0.9348398,0.0006117832,0.0611389,0.0001900022,0.0001312817,0.0002687178,0.00009968708,0.00009788686,0.002622041],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004285163,"threshold_uncertainty_score":0.02266234,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1307781873236767,"score_gpt":0.3125012498775136,"score_spread":0.1817230625538369,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}