{"id":"W3206746211","doi":"10.1109/icra48506.2021.9561017","title":"Distilling a Hierarchical Policy for Planning and Control via Representation and Reinforcement Learning","year":2021,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Kootenay Association for Science & Technology","funders":"","keywords":"Reinforcement learning; Computer science; Hierarchy; Task (project management); Set (abstract data type); Artificial intelligence; Representation (politics); Control (management); Latent variable; Imitation; Machine learning; Sequence (biology); State space; Human–computer interaction; Engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001141556,0.0008899278,0.0007978723,0.0004597194,0.0003835169,0.0007943416,0.001268404,0.0009034648,0.002050863],"category_scores_gemma":[0.003119426,0.0005169178,0.0006402358,0.0004383522,0.001267702,0.001405141,0.001284936,0.001717003,0.0004544181],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001404539,"about_ca_system_score_gemma":0.002587317,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008594135,"about_ca_topic_score_gemma":0.007819917,"domain_scores_codex":[0.9993588,0.0001958335,0.00003435607,0.0001658091,0.0001528538,0.00009238599],"domain_scores_gemma":[0.999083,0.0004895854,0.0001172876,0.0001279995,0.0001164047,0.0000656548],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006255886,0.00005575053,0.0003832869,0.00005213268,0.00002054365,0.00005290045,0.00009626417,0.933231,0.002620812,0.02587397,0.0007658131,0.036785],"study_design_scores_gemma":[0.000008120094,0.00001618947,0.0000308751,0.00000359818,0.000002717184,0.000004616729,0.000003694774,0.9925905,0.0003877097,0.006740368,0.0002076191,0.000004021156],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007551275,0.00006563818,0.9908274,0.0001072501,0.00001218856,0.00003652904,0.00002868808,0.0005025663,0.0008684375],"genre_scores_gemma":[0.6421515,0.0001604141,0.3550629,0.0001215219,0.00002767224,0.000321444,0.0001676391,0.0001089758,0.001877973],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008594135,"threshold_uncertainty_score":0.01708817,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02105963226643383,"score_gpt":0.2996378555369776,"score_spread":0.2785782232705438,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}