{"id":"W2885541157","doi":"10.1109/tac.2020.2978037","title":"On Passivity, Reinforcement Learning, and Higher Order Learning in Multiagent Finite Games","year":2020,"lang":"en","type":"article","venue":"IEEE Transactions on Automatic Control","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":38,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Convergence (economics); Monotonic function; Nash equilibrium; Stochastic game; Property (philosophy); Class (philosophy); Exploit","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004281653,0.00135634,0.001210131,0.0008917022,0.0006105929,0.001488073,0.00142349,0.001415522,0.002310334],"category_scores_gemma":[0.009662424,0.0005203655,0.001345419,0.0004632297,0.004161361,0.002208078,0.001805981,0.002600465,0.0003408917],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002055613,"about_ca_system_score_gemma":0.001561801,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002782039,"about_ca_topic_score_gemma":0.001494909,"domain_scores_codex":[0.9984941,0.0007262518,0.00007618922,0.0002020242,0.000366798,0.0001344866],"domain_scores_gemma":[0.9941556,0.004248688,0.0005719382,0.0003554983,0.0004441917,0.000224031],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00003310235,0.00004338521,0.0003635507,0.0001047348,0.00004572195,0.00009264908,0.0001782545,0.5576178,0.001809723,0.4289694,0.0002982715,0.01044332],"study_design_scores_gemma":[0.00001131802,0.00006545911,0.00008157533,0.00002067508,0.000007656255,0.00002275042,0.00001190533,0.8529747,0.0005416055,0.1455318,0.0007180693,0.00001267117],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.006965186,0.0002340515,0.9892566,0.0001853956,0.00002314969,0.00003287004,0.00001090748,0.00004611723,0.003245733],"genre_scores_gemma":[0.8550587,0.001036746,0.1379388,0.000235745,0.0001161347,0.0003649218,0.00004638863,0.00007802343,0.005124586],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004281653,"threshold_uncertainty_score":0.0226438,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01571176188537983,"score_gpt":0.2457269065098175,"score_spread":0.2300151446244377,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}