{"id":"W3171711942","doi":"10.1109/syscon48628.2021.9447080","title":"Optimization of Deep Reinforcement Learning with Hybrid Multi-Task Learning","year":2021,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Tech University","funders":"","keywords":"Reinforcement learning; Computer science; Artificial intelligence; Task (project management); Machine learning; Deep learning; Learning classifier system; Robot learning; Multi-task learning; Active learning (machine learning); Engineering; Robot","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001400432,0.0009492926,0.0009075463,0.0003311788,0.0002790254,0.0007743155,0.001142025,0.001107201,0.001571184],"category_scores_gemma":[0.002197598,0.0003830554,0.000460223,0.0002764611,0.0008716422,0.0007145113,0.001327442,0.001013129,0.0002065077],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000810565,"about_ca_system_score_gemma":0.001276367,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003686401,"about_ca_topic_score_gemma":0.00277682,"domain_scores_codex":[0.9994841,0.0001637974,0.00002422574,0.0001081256,0.000119805,0.0000998935],"domain_scores_gemma":[0.9991781,0.0004180935,0.0001164504,0.0000537184,0.0001623619,0.00007125218],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004577748,0.00003561545,0.0002130271,0.00002233023,0.00002389191,0.00004291947,0.00001686782,0.9857309,0.0007820594,0.002196631,0.0002460963,0.01064384],"study_design_scores_gemma":[0.000005663052,0.00001665781,0.0000214246,0.000001305129,0.000001940731,0.000003304577,0.000001354331,0.9991184,0.0001180122,0.000635116,0.00007560204,0.000001237966],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04362347,0.0003167276,0.9512618,0.0002655221,0.00006674986,0.00007112835,0.00003324442,0.0003908834,0.003970422],"genre_scores_gemma":[0.9405478,0.00009574057,0.05650033,0.0001217727,0.00002760286,0.000147814,0.00004683343,0.00003429921,0.002477886],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003686401,"threshold_uncertainty_score":0.007406235,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01323072726757158,"score_gpt":0.2300208503905229,"score_spread":0.2167901231229513,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}