{"id":"W2767354950","doi":"10.1609/aaai.v32i1.11740","title":"Learning With Options That Terminate Off-Policy","year":2018,"lang":"en","type":"preprint","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Dilemma; Flexibility (engineering); Computer science; Odds; Decoupling (probability); Set (abstract data type); Quality (philosophy); Task (project management); Reinforcement learning; Mathematical optimization; Artificial intelligence; Economics; Mathematics; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003333007,0.001056482,0.001186343,0.0004634181,0.0005411088,0.001410446,0.00183304,0.00239384,0.00407026],"category_scores_gemma":[0.01983122,0.000487298,0.0008130764,0.0004145619,0.00218879,0.003498546,0.002279962,0.003676224,0.0006277933],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001300292,"about_ca_system_score_gemma":0.001931746,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001224269,"about_ca_topic_score_gemma":0.00157109,"domain_scores_codex":[0.9986358,0.0004965664,0.00008892025,0.0003518707,0.0002336366,0.0001930653],"domain_scores_gemma":[0.991474,0.005993637,0.0005825981,0.001030743,0.0005034529,0.0004155097],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00049189,0.0002887382,0.005068358,0.0001842399,0.00007613678,0.0002607995,0.0003485868,0.6519833,0.003230829,0.1959499,0.002983818,0.1391334],"study_design_scores_gemma":[0.00003397598,0.00007659111,0.0001399023,0.00003065309,0.00001022181,0.00003069468,0.00002148711,0.9247141,0.001147264,0.0730402,0.0007447589,0.00001010862],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06901426,0.0001870513,0.9232509,0.0007430632,0.00007037116,0.0001173163,0.0000782988,0.000742127,0.005796607],"genre_scores_gemma":[0.7644131,0.0001707196,0.2276432,0.0004970367,0.00006737497,0.0003204165,0.0002726197,0.0002810854,0.006334445],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00407026,"threshold_uncertainty_score":0.01762682,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08436074975531656,"score_gpt":0.3127829237718858,"score_spread":0.2284221740165693,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}