{"id":"W2115253045","doi":"","title":"Off-policy Learning with Options and Recognizers","year":2005,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; McGill University","funders":"","keywords":"Variance (accounting); Computer science; Convergence (economics); Function (biology); Temporal difference learning; Reinforcement learning; Sampling (signal processing); Filter (signal processing); Function approximation; State (computer science); Importance sampling; Artificial intelligence; Policy learning; Algorithm; Machine learning; Mathematical optimization; Mathematics; Statistics; Artificial neural network","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0002476567,0.0001331361,0.0001278034,0.0002497463,0.000369001,0.001236707,0.0002521688,0.0000536808,0.000001441377],"category_scores_gemma":[0.00007667051,0.0001090727,0.00001571186,0.0004754566,0.00004427679,0.006235723,0.00007316451,0.0002173378,0.00005960893],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00007165846,"about_ca_system_score_gemma":0.0001036522,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00002074562,"about_ca_topic_score_gemma":9.826948e-7,"domain_scores_codex":[0.9988955,0.0000449528,0.0003727642,0.0001294066,0.0003188353,0.0002386027],"domain_scores_gemma":[0.9991945,0.00003362737,0.0003308441,0.0001607483,0.00019391,0.00008636154],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000002891196,0.000002473337,0.0003679472,0.00009469855,0.000004680024,2.769281e-7,0.001984689,0.8647634,0.00001762239,0.003146747,0.0001064889,0.129508],"study_design_scores_gemma":[0.0002773679,0.00007803053,0.0002427784,0.00009299188,0.000003723707,0.0000817227,0.0002672425,0.9515973,0.00004167815,0.000003084619,0.04716873,0.000145319],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.009853139,0.0002749762,0.9760786,0.001716383,0.0001517991,0.000291611,4.689744e-7,0.0005965691,0.01103641],"genre_scores_gemma":[0.9875802,0.0000310526,0.01062248,0.0003690031,0.0001222518,0.00002314639,0.000008981962,0.000007942617,0.001234894],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9777271,"threshold_uncertainty_score":0.9998001,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01260585407427968,"score_gpt":0.2424030683691066,"score_spread":0.2297972142948269,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}