{"id":"W7124298994","doi":"10.65109/nind4053","title":"Do As You Teach: A Multi-Teacher Approach to Self-Play in Deep Reinforcement Learning","year":2023,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Institut national de psychiatrie légale Philippe-Pinel","funders":"","keywords":"Reinforcement learning; Automation; Robot; State (computer science); Task (project management); Robotics; Robot learning; Train","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.004267755,0.001049787,0.0009305765,0.001769033,0.0006811721,0.001517834,0.003173783,0.0005374193,0.0006912079],"category_scores_gemma":[0.0009855053,0.001080199,0.0003210179,0.005625242,0.0001109904,0.001118328,0.003476232,0.00229434,0.01218423],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000867501,"about_ca_system_score_gemma":0.0004084605,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000423023,"about_ca_topic_score_gemma":0.00001520559,"domain_scores_codex":[0.9902124,0.0007405019,0.001914633,0.002302623,0.00213413,0.002695734],"domain_scores_gemma":[0.9961407,0.0002647751,0.0004914356,0.002005035,0.0002394131,0.0008586653],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002723152,0.0002998024,0.008247243,0.0001154643,0.0001295029,0.0000677817,0.04515642,0.9303787,0.00006484547,0.006828169,0.000869034,0.007815845],"study_design_scores_gemma":[0.001988588,0.0007430831,0.003511607,0.0001534713,0.00004042608,0.00002575343,0.003854888,0.9692798,0.00008595527,0.00001873977,0.01901789,0.001279795],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006722679,0.00008125304,0.8710034,0.0005924391,0.0009255485,0.001954756,1.806282e-7,0.001484059,0.1172357],"genre_scores_gemma":[0.7700882,0.000146701,0.08586513,0.0006732831,0.0001974986,0.000193273,0.00003027414,0.0001279006,0.1426778],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.7851382,"threshold_uncertainty_score":0.9995187,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0385510444796588,"score_gpt":0.2879504930576487,"score_spread":0.2493994485779899,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}