{"id":"W3098974658","doi":"","title":"Promoting Coordination through Policy Regularization in Multi-Agent Deep Reinforcement Learning","year":2019,"lang":"en","type":"article","venue":"PolyPublie (École Polytechnique de Montréal)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Polytechnique Montréal; Université de Montréal","funders":"","keywords":"Reinforcement learning; Computer science; Regularization (linguistics); Predictability; Action selection; Artificial intelligence; Machine learning; Action (physics); Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001058961,0.000362509,0.0003539574,0.0007256871,0.0002411509,0.00041488,0.00103069,0.0002660954,0.00002204943],"category_scores_gemma":[0.0005488249,0.0003976503,0.0001182096,0.001597643,0.0000397071,0.001547208,0.000617641,0.0006554033,0.00008756587],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001359546,"about_ca_system_score_gemma":0.0002754921,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002084565,"about_ca_topic_score_gemma":0.0001503878,"domain_scores_codex":[0.9967493,0.0002566543,0.0007809322,0.0006577527,0.0006563184,0.0008990144],"domain_scores_gemma":[0.9980805,0.0001020251,0.0005183038,0.0009750823,0.0001730967,0.0001510219],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000009538604,0.00006309537,0.02568623,0.00004911592,0.00001611104,0.00001135381,0.002623296,0.8661646,0.003663191,0.09651799,0.00002061207,0.005174825],"study_design_scores_gemma":[0.0008982678,0.0002065534,0.009545413,0.0001133616,0.000006157691,0.00002179827,0.000096295,0.9817286,0.004907825,0.0009740678,0.001101135,0.0004005378],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01106373,0.0001042351,0.9822093,0.002745376,0.0001695739,0.001343697,2.690519e-7,0.0007872606,0.001576556],"genre_scores_gemma":[0.8346161,0.00005505499,0.1571299,0.0008941086,0.00005567097,0.0001835259,0.00003226018,0.00004973176,0.006983709],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8250794,"threshold_uncertainty_score":0.9998475,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01428494191820764,"score_gpt":0.2518850997686436,"score_spread":0.237600157850436,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}