{"id":"W2963558674","doi":"","title":"Context-dependent upper-confidence bounds for directed exploration","year":2018,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Computer science; Context (archaeology); Computation; Machine learning; Artificial intelligence; Variance (accounting); Mathematical optimization; Algorithm; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005353631,0.001945083,0.001790665,0.001800928,0.0006992685,0.002513555,0.003203173,0.00228955,0.004003085],"category_scores_gemma":[0.06969464,0.001126754,0.00138557,0.001071445,0.002781718,0.004664047,0.004691607,0.006025323,0.0008666658],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002200061,"about_ca_system_score_gemma":0.002554492,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003035007,"about_ca_topic_score_gemma":0.003181372,"domain_scores_codex":[0.996012,0.0011051,0.0003107778,0.0007837035,0.001437536,0.000350939],"domain_scores_gemma":[0.9560038,0.03540703,0.002341912,0.002298325,0.00311081,0.0008383035],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001018265,0.00007040889,0.0009698929,0.000136807,0.00004821843,0.00005295486,0.0001109969,0.9151457,0.001422248,0.05186247,0.0008803701,0.02919815],"study_design_scores_gemma":[0.000007767883,0.00002369187,0.00007964202,0.00002941437,0.000005969854,0.00001371767,0.000005139053,0.9804952,0.0006788913,0.01841238,0.0002384764,0.000009772924],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005013588,0.0003254371,0.9927763,0.0001670206,0.0000241778,0.00003245762,0.00004297247,0.0002508873,0.001367206],"genre_scores_gemma":[0.6568794,0.0008424612,0.3375142,0.0005004688,0.0001355112,0.0006586001,0.0003861658,0.0004584333,0.002624716],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005353631,"threshold_uncertainty_score":0.02831304,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03561658697522566,"score_gpt":0.2804357901936462,"score_spread":0.2448192032184205,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}