{"id":"W2963134677","doi":"10.1609/aaai.v32i1.11740","title":"Learning With Options That Terminate Off-Policy","year":2018,"lang":"en","type":"article","venue":"","topic":"Auction Theory and Applications","field":"Decision Sciences","cited_by":14,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Computer science; Dilemma; Flexibility (engineering); Odds; Set (abstract data type); Decoupling (probability); Quality (philosophy); Reinforcement learning; Task (project management); Mathematical optimization; Artificial intelligence; Economics; Mathematics; Machine learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0007168237,0.00006571527,0.00008253261,0.0001675285,0.0005223278,0.0001431246,0.0003141687,0.00002966507,0.00326199],"category_scores_gemma":[0.0003143233,0.00003908377,0.0000322707,0.0007589723,0.0003147134,0.000257301,0.00005934482,0.00008455331,0.004474349],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001199191,"about_ca_system_score_gemma":0.00004763455,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001360374,"about_ca_topic_score_gemma":0.00002370747,"domain_scores_codex":[0.9990344,0.00008469036,0.0001514717,0.0002464568,0.000344643,0.0001383457],"domain_scores_gemma":[0.9990365,0.0002578475,0.00009346101,0.0003558062,0.0001796712,0.00007672561],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00002997873,0.00005791551,0.006092292,6.047575e-7,0.00001153293,0.00000136913,0.001183096,0.0002113184,0.0007139161,0.6898961,0.009144829,0.292657],"study_design_scores_gemma":[0.0002185694,0.0002098082,0.01290279,0.00000567244,0.000007260513,0.00004854926,0.004093385,0.001532652,0.005965271,0.1442489,0.8305901,0.0001770133],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.3687244,0.00001160002,0.1319804,0.006052183,0.0000896688,0.0001572971,0.000003411385,0.0002129185,0.4927681],"genre_scores_gemma":[0.8612155,0.000004423193,0.001721113,0.0002946463,0.0001892949,0.00001480374,8.59163e-7,0.000004991322,0.1365543],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8214453,"threshold_uncertainty_score":0.9976492,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09528522548544098,"score_gpt":0.4151313772490284,"score_spread":0.3198461517635874,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}