{"id":"W4390489156","doi":"10.1109/ssci52147.2023.10371909","title":"Hierarchical Reinforcement Learning for Non-Stationary Environments","year":2023,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University; Carleton University","funders":"","keywords":"Reinforcement learning; Computer science; Process (computing); Temporal difference learning; Action (physics); Differential game; Term (time); Artificial intelligence; Mathematical optimization; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001339993,0.0007290999,0.0009010033,0.0003910867,0.000382955,0.0006084437,0.00111834,0.0008229006,0.001830463],"category_scores_gemma":[0.004945545,0.0003421068,0.0004019936,0.0002321355,0.001038216,0.001020565,0.001104371,0.001275502,0.000233993],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001188369,"about_ca_system_score_gemma":0.001194488,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009505447,"about_ca_topic_score_gemma":0.007901312,"domain_scores_codex":[0.9993504,0.000212386,0.00003355951,0.0001453392,0.000138578,0.000119759],"domain_scores_gemma":[0.9977911,0.00138314,0.0002806667,0.000150457,0.0002364706,0.00015819],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008085149,0.00006808189,0.0008815458,0.00005214592,0.00002578502,0.00007977006,0.00008692831,0.9628569,0.00133626,0.01090485,0.0004178747,0.02320905],"study_design_scores_gemma":[0.000008986557,0.00002245722,0.00008039318,0.00000191667,0.000002539338,0.000004634291,0.000003998652,0.9956046,0.0001433949,0.00403127,0.00009340751,0.000002491321],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.06730651,0.0002993218,0.9289917,0.0002808007,0.0000383125,0.00006283887,0.00003710033,0.0005647226,0.002418706],"genre_scores_gemma":[0.9581595,0.00009202505,0.03959597,0.00008087076,0.00001888549,0.00007885979,0.00004773851,0.00002843968,0.001897823],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009505447,"threshold_uncertainty_score":0.01890028,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02224100655619201,"score_gpt":0.2667573711172034,"score_spread":0.2445163645610114,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}