{"id":"W2970673985","doi":"","title":"Learning Reward Machines for Partially Observable Reinforcement Learning","year":2019,"lang":"en","type":"article","venue":"Neural Information Processing Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":67,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Observable; Computer science; Set (abstract data type); Artificial intelligence; Task (project management); Function (biology); Optimization problem; Learning automata; Representation (politics); Decomposition; Automaton; Mathematical optimization; Mathematics; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001945371,0.001081251,0.001263947,0.0004566692,0.0003914511,0.001193305,0.001308674,0.001370868,0.00357953],"category_scores_gemma":[0.009478923,0.0004866762,0.0006492151,0.0004970412,0.001473311,0.001651616,0.001168062,0.003176733,0.0006099307],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001200085,"about_ca_system_score_gemma":0.001264338,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00144634,"about_ca_topic_score_gemma":0.001833881,"domain_scores_codex":[0.9988599,0.0005788087,0.00006771642,0.0002061294,0.0002050577,0.00008234437],"domain_scores_gemma":[0.995553,0.003353719,0.0002802691,0.0003624918,0.0003376862,0.0001128223],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0000614399,0.00005809307,0.000379242,0.0001071988,0.0000361774,0.00004471012,0.00005370625,0.8422977,0.0007142099,0.1111339,0.001594227,0.04351942],"study_design_scores_gemma":[0.00001018239,0.00001230127,0.0000243857,0.000006967145,0.000002794348,0.000004916034,0.000002649256,0.9647503,0.000185866,0.03450331,0.0004927926,0.000003500462],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003930284,0.000240439,0.9934905,0.0002404115,0.00003601919,0.00004475241,0.0000463026,0.0005224401,0.001448881],"genre_scores_gemma":[0.569917,0.0005914341,0.4243037,0.000365898,0.0001457614,0.0008673118,0.0002886441,0.000220695,0.0032997],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00357953,"threshold_uncertainty_score":0.01197469,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02100086568913788,"score_gpt":0.2534669585508525,"score_spread":0.2324660928617146,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}