{"id":"W3098974658","doi":"","title":"Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning","year":2019,"lang":"en","type":"article","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Polytechnique Montréal; Université de Montréal","funders":"","keywords":"Reinforcement learning; Computer science; Regularization (linguistics); Predictability; Action selection; Artificial intelligence; Machine learning; Action (physics); Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00281437,0.001016569,0.00100494,0.0004024845,0.000512996,0.0007594129,0.001461278,0.001253654,0.0009503876],"category_scores_gemma":[0.009064031,0.0005470474,0.0003467868,0.0003161076,0.001640367,0.001205583,0.001494813,0.001962151,0.0002263651],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001110361,"about_ca_system_score_gemma":0.001501877,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003887568,"about_ca_topic_score_gemma":0.004644104,"domain_scores_codex":[0.9991422,0.0004234074,0.00003843873,0.0001479354,0.0001421377,0.0001059317],"domain_scores_gemma":[0.9963097,0.0023677,0.0004894438,0.0003175555,0.0002934996,0.0002220907],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00006886323,0.00008461949,0.001043123,0.00003035809,0.00003446238,0.00003763668,0.00006718428,0.9694571,0.001305736,0.006549342,0.0005940478,0.02072739],"study_design_scores_gemma":[0.000009121997,0.00001747778,0.00003813184,0.000003068329,0.000002048815,0.000003390615,0.000003403957,0.9976305,0.0001949434,0.002009035,0.00008668967,0.000002217127],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0590116,0.0002767433,0.9377426,0.0005150473,0.00004855321,0.00006192238,0.0000235427,0.0006930861,0.001626924],"genre_scores_gemma":[0.9184997,0.00009730717,0.07955124,0.0002413505,0.00003753011,0.0001371756,0.00004109947,0.00008310449,0.001311401],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003887568,"threshold_uncertainty_score":0.014884,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01428494191820764,"score_gpt":0.2518850997686436,"score_spread":0.237600157850436,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}