{"id":"W6947979547","doi":"10.48448/xpf1-k446","title":"Contextual Policy Transfer in Reinforcement Learning Domains via Deep Mixtures-of-Experts","year":2021,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"Species Distribution and Climate Change","field":"Environmental Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Reinforcement learning; Robustness (evolution); Reuse; Transfer of learning; Task (project management); Bayesian probability; Policy learning; Q-learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002879614,0.001411916,0.00140591,0.000546824,0.0004651627,0.00100168,0.002073012,0.001832191,0.002744798],"category_scores_gemma":[0.009081836,0.0007690309,0.0007394592,0.0004921404,0.001378576,0.00211952,0.002591962,0.003003933,0.0005970809],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001561368,"about_ca_system_score_gemma":0.00152247,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008978701,"about_ca_topic_score_gemma":0.007887949,"domain_scores_codex":[0.9989127,0.0004745562,0.00004747126,0.000271224,0.0001518481,0.000142247],"domain_scores_gemma":[0.997115,0.00197917,0.0002199679,0.0002622739,0.0002314292,0.0001921062],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001749535,0.0001264593,0.0007573448,0.00005900753,0.00005116235,0.00005578692,0.0001028582,0.9401767,0.0008837209,0.00766487,0.0009531874,0.048994],"study_design_scores_gemma":[0.00001205014,0.00002101502,0.00004619671,0.000004870128,0.000004071885,0.000004956285,0.000004530009,0.9933761,0.0003012119,0.006038262,0.0001823592,0.000004362159],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.04936135,0.0006788309,0.9446424,0.0004417845,0.00007195127,0.00008858441,0.00009762638,0.001879349,0.002738063],"genre_scores_gemma":[0.8734189,0.000231882,0.1227589,0.0003197983,0.00005296936,0.0001500244,0.0001759587,0.0001778241,0.002713713],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.008978701,"threshold_uncertainty_score":0.01785284,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02042084115145876,"score_gpt":0.2806425444615363,"score_spread":0.2602217033100775,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}