{"id":"W7124241411","doi":"10.65109/ldqz4728","title":"Learning from Multiple Independent Advisors in Multi-agent Reinforcement Learning","year":2023,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo; University of Alberta; Vector Institute","funders":"","keywords":"Reinforcement learning; Sample complexity; Set (abstract data type); Sample (material); Convergence (economics); Action (physics); Error-driven learning; State (computer science)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004649707,0.00143155,0.002231447,0.0006387405,0.0006642833,0.001045132,0.002317428,0.002153885,0.001671243],"category_scores_gemma":[0.01168959,0.0008519909,0.0005538057,0.0005929685,0.001898984,0.001867095,0.001692112,0.002584441,0.0003691181],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001287391,"about_ca_system_score_gemma":0.001940046,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005327979,"about_ca_topic_score_gemma":0.005815053,"domain_scores_codex":[0.998189,0.0007984242,0.0001028063,0.0004008346,0.0003049353,0.0002039496],"domain_scores_gemma":[0.9929156,0.004891904,0.0007062517,0.0004056072,0.0006330077,0.0004475325],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001510548,0.0001188846,0.00162583,0.00006997721,0.00005681039,0.00008693039,0.00009373591,0.9442922,0.0006229182,0.006950924,0.0005501757,0.04538051],"study_design_scores_gemma":[0.0000270867,0.00003578593,0.0000813674,0.000006875179,0.000007777845,0.00001209412,0.000006549602,0.994584,0.0002911742,0.0048002,0.0001410896,0.000006007777],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03463811,0.0003049895,0.9628806,0.0003388608,0.00003202815,0.0001220648,0.00003101188,0.0005563411,0.00109605],"genre_scores_gemma":[0.8469832,0.0001244314,0.150545,0.0002731439,0.00004496183,0.0002330007,0.00007382651,0.00007138947,0.001651002],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005327979,"threshold_uncertainty_score":0.02459031,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05499245184937777,"score_gpt":0.2792454045787129,"score_spread":0.2242529527293352,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}