{"id":"W3093099641","doi":"10.22215/etd/2017-11788","title":"On Multi-Agent Reinforcement Learning in Matrix, Stochastic and Differential Games","year":2017,"lang":"en","type":"dissertation","venue":"","topic":"Guidance and Control Systems","field":"Engineering","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Carleton University; Dalhousie University","funders":"","keywords":"Nash equilibrium; Reinforcement learning; Best response; Computer science; Convergence (economics); Mathematical optimization; Epsilon-equilibrium; Pursuer; Solution concept; Mathematics; Algorithm; Mathematical economics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003148353,0.001313557,0.001523086,0.0006887662,0.0006606713,0.001396591,0.001565378,0.001448264,0.002494745],"category_scores_gemma":[0.009277374,0.0004055305,0.00105749,0.000977593,0.002349346,0.002539141,0.001509211,0.00227271,0.0003585202],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00207736,"about_ca_system_score_gemma":0.001694727,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006004865,"about_ca_topic_score_gemma":0.002661429,"domain_scores_codex":[0.9982849,0.0009255894,0.00006995212,0.0002510631,0.0003086106,0.0001598568],"domain_scores_gemma":[0.9944028,0.004500225,0.0003464557,0.0001644107,0.0004233744,0.0001626683],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.00003615753,0.00006566719,0.0004672047,0.0001036268,0.00005169084,0.00007319558,0.00009368324,0.8315913,0.0003706403,0.1523734,0.0006977684,0.0140757],"study_design_scores_gemma":[0.00001229515,0.00003311821,0.00005434098,0.0000131039,0.000005494921,0.00001073936,0.000009190177,0.9562952,0.00009769685,0.04274484,0.0007178522,0.000006189276],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"other","genre_scores_codex":[0.01123383,0.001040059,0.9811174,0.0005635452,0.0001004922,0.00007092771,0.00002418534,0.00006262399,0.005786823],"genre_scores_gemma":[0.797012,0.003259163,0.1886842,0.0006022674,0.0003859081,0.0004835772,0.00009587987,0.00007800436,0.009398935],"genre_candidate":"other","genre_consensus":null,"teacher_disagreement_score":0.006004865,"threshold_uncertainty_score":0.01665026,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009605333763256119,"score_gpt":0.2504946084800244,"score_spread":0.2408892747167683,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}