{"id":"W2963558674","doi":"","title":"Context-dependent upper-confidence bounds for directed exploration","year":2018,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Reinforcement learning; Computer science; Context (archaeology); Computation; Machine learning; Artificial intelligence; Variance (accounting); Mathematical optimization; Algorithm; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0005007542,0.0001760085,0.000195384,0.0001889084,0.0005320724,0.002100574,0.0006141816,0.00009244297,0.000003349745],"category_scores_gemma":[0.0002183737,0.0001600986,0.00005500822,0.0003722262,0.00006745748,0.01079019,0.00008401065,0.0001134451,0.0001356408],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00009974746,"about_ca_system_score_gemma":0.0001261052,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003808277,"about_ca_topic_score_gemma":0.000002596119,"domain_scores_codex":[0.9981853,0.00004949502,0.0007002925,0.0002072824,0.0005362366,0.0003213946],"domain_scores_gemma":[0.9979626,0.00006831512,0.0005282941,0.000376287,0.0009848616,0.00007965672],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001273028,0.00005814899,0.0006334733,0.002039584,0.0001018051,0.000002176462,0.04183935,0.4130455,0.001543471,0.1152487,0.01577128,0.4095893],"study_design_scores_gemma":[0.0003816083,0.0001979508,0.0000493572,0.000109153,0.000006646257,0.00001791506,0.0004763891,0.9697233,0.001488938,0.0001253736,0.02722634,0.0001970009],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.001193186,0.00009977607,0.9934945,0.0003785633,0.001715937,0.0006450327,0.000002286368,0.0007464642,0.001724272],"genre_scores_gemma":[0.9945136,0.000003307187,0.003879485,0.0004875647,0.00023795,0.0001502364,0.0000283888,0.000009894326,0.0006896007],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9933204,"threshold_uncertainty_score":0.9989353,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03561658697522566,"score_gpt":0.2804357901936462,"score_spread":0.2448192032184205,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}