{"id":"W2970130737","doi":"10.48550/arxiv.1909.02128","title":"No Press Diplomacy: Modeling Multi-Agent Gameplay","year":2019,"lang":"en","type":"article","venue":"arXiv (Cornell University)","topic":"Opinion Dynamics and Social Influence","field":"Physics and Astronomy","cited_by":15,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University; Université de Montréal","funders":"","keywords":"Diplomacy; Reinforcement learning; Computer science; Teamwork; Benchmark (surveying); Artificial intelligence; Multi-agent system; Artificial neural network; Political science; Law","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0009835402,0.0006276775,0.0005120428,0.0004639573,0.0003332521,0.0008406466,0.001016577,0.000930277,0.00173696],"category_scores_gemma":[0.005412252,0.0003063704,0.0004424982,0.0002046421,0.000952576,0.0008261667,0.0006782435,0.001121677,0.0002070541],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001405919,"about_ca_system_score_gemma":0.0006445966,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0142738,"about_ca_topic_score_gemma":0.01407281,"domain_scores_codex":[0.9996638,0.0001524724,0.00001298919,0.0000896114,0.00003185196,0.00004925622],"domain_scores_gemma":[0.9974504,0.001857536,0.0003142101,0.0000853735,0.0001365082,0.0001558354],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007735399,0.00007556907,0.004246004,0.00002602279,0.00002515029,0.00004873163,0.00009148595,0.983813,0.000326655,0.005665079,0.0004705618,0.005134266],"study_design_scores_gemma":[0.000003591213,0.000006870715,0.0001547667,0.00000136958,9.17153e-7,0.0000019225,0.000004134601,0.9987195,0.00002981711,0.001015649,0.00006031972,0.000001097372],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8042741,0.0005719565,0.1857391,0.001051713,0.0001191961,0.0001465078,0.0004963968,0.0004600273,0.007141003],"genre_scores_gemma":[0.9888201,0.00005870186,0.009309147,0.00005376254,0.00001637764,0.00006654546,0.0001127661,0.0000163421,0.001546299],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.0142738,"threshold_uncertainty_score":0.02838141,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05642456405587556,"score_gpt":0.2053329976250018,"score_spread":0.1489084335691262,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}