{"id":"W7124257082","doi":"10.65109/ehmm3042","title":"Search-Improved Game-Theoretic Multiagent Reinforcement Learning in General and Negotiation Games","year":2023,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Reinforcement learning; Negotiation; Generative grammar; Bayesian probability; Test (biology); Representation (politics); Bayesian inference; Social learning; Reinforcement","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002195913,0.0005553139,0.0005222377,0.0009685073,0.000332315,0.0009477703,0.0008451207,0.0002537509,0.0003517623],"category_scores_gemma":[0.0005130974,0.0005722512,0.0001339996,0.001950742,0.000317597,0.0009105267,0.001693334,0.0009973377,0.0005240455],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003318914,"about_ca_system_score_gemma":0.000262111,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0003337971,"about_ca_topic_score_gemma":0.0000174427,"domain_scores_codex":[0.994535,0.0005400681,0.001218497,0.001168672,0.001031041,0.001506671],"domain_scores_gemma":[0.9979499,0.0003706779,0.0003268058,0.0008024621,0.000183642,0.0003665302],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002898185,0.00002495029,0.006432579,0.0001613833,0.00004275226,0.00003593967,0.008074931,0.9401048,0.001439968,0.01572107,0.0001168622,0.02781573],"study_design_scores_gemma":[0.001692072,0.0006377361,0.01733691,0.0001577196,0.00002140034,0.000008117941,0.0006922274,0.976266,0.001381125,0.0001345475,0.001059061,0.0006131078],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1442438,0.0001559407,0.8487434,0.001554032,0.0008018867,0.00113308,4.019504e-7,0.0005214381,0.002845998],"genre_scores_gemma":[0.9589145,0.001768512,0.005456893,0.0003514666,0.0001458015,0.00004496274,0.00003033894,0.0000561341,0.03323145],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8432866,"threshold_uncertainty_score":0.9996729,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0221885923684442,"score_gpt":0.2702905656329382,"score_spread":0.248101973264494,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}