{"id":"W4388342252","doi":"10.1002/aisy.202300352","title":"A Multiobjective Collaborative Deep Reinforcement Learning Algorithm for Jumping Optimization of Bipedal Robot","year":2023,"lang":"en","type":"article","venue":"Advanced Intelligent Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":11,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University","funders":"Government of Jiangsu Province; Natural Science Foundation of Jiangsu Province; National Natural Science Foundation of China","keywords":"Reinforcement learning; Computer science; Markov decision process; Convergence (economics); Robot; Jumping; Artificial intelligence; Q-learning; Nonlinear system; Robotics; Mathematical optimization; Machine learning; Markov process; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0006315697,0.0007091839,0.0008720791,0.0003092271,0.00032626,0.0004833729,0.0009357219,0.0009300869,0.002127284],"category_scores_gemma":[0.001070868,0.0003626386,0.0004323662,0.0002372029,0.000462358,0.000441397,0.0009501291,0.001101891,0.0002557225],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005820642,"about_ca_system_score_gemma":0.001069724,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006523575,"about_ca_topic_score_gemma":0.004750811,"domain_scores_codex":[0.9998305,0.00003396046,0.000009656935,0.00004380692,0.00004473121,0.00003736635],"domain_scores_gemma":[0.9996773,0.0001560632,0.00004287626,0.00001882784,0.00007087359,0.00003399926],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00004609089,0.00003609782,0.0003846324,0.00004083633,0.00002991533,0.00005521937,0.00003417207,0.9464132,0.001865487,0.003052241,0.0007858797,0.04725635],"study_design_scores_gemma":[0.000004759556,0.00001191221,0.00002179284,0.000001965914,0.000001961883,0.000003544927,0.000001454753,0.9993457,0.000130428,0.0003822773,0.00009279848,0.000001416131],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02068157,0.0002190216,0.9761524,0.0001363371,0.00004380432,0.00004041659,0.00002261618,0.0004684374,0.002235306],"genre_scores_gemma":[0.8224848,0.0001322884,0.1723908,0.0001753021,0.00003016428,0.0001899406,0.000098923,0.00007861252,0.004419071],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006523575,"threshold_uncertainty_score":0.01297122,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02051099909052159,"score_gpt":0.2888989493345185,"score_spread":0.268387950243997,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}