{"id":"W3013464227","doi":"10.1109/ieeeconf44664.2019.9049021","title":"Decentralized Q-Learning with Constant Aspirations in Stochastic Games","year":2019,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Reinforcement learning; Computer science; Convergence (economics); Constant (computer programming); Mathematical optimization; State (computer science); Control (management); Information structure; Fictitious play; Complete information; Function (biology); Obstacle; Nash equilibrium; Artificial intelligence; Mathematical economics; Mathematics; Algorithm; Economics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002608389,0.0008370266,0.001515612,0.0004776219,0.0006989191,0.001112119,0.001527701,0.001250262,0.002099827],"category_scores_gemma":[0.01210123,0.0005974604,0.0004335974,0.0004208409,0.00225933,0.00179919,0.002141346,0.001837017,0.0002764862],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001627906,"about_ca_system_score_gemma":0.002193077,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006563062,"about_ca_topic_score_gemma":0.004983889,"domain_scores_codex":[0.9986032,0.0005689602,0.00006526621,0.0003009768,0.0002480355,0.0002136129],"domain_scores_gemma":[0.9943462,0.004124762,0.0005056055,0.0002473935,0.0004287633,0.0003473847],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009085602,0.00006008779,0.0006837398,0.00006149278,0.00002503609,0.00008668756,0.0001330359,0.9251592,0.0007844126,0.05741264,0.0005934017,0.01490933],"study_design_scores_gemma":[0.00002290942,0.0000202642,0.00005498635,0.000004043228,0.000002437062,0.000008633799,0.000008328286,0.9769723,0.000110465,0.02264144,0.0001497853,0.000004323963],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04143185,0.0001660858,0.9545221,0.0004170854,0.00002873389,0.00008325186,0.00003666684,0.0002151631,0.003099078],"genre_scores_gemma":[0.9246294,0.0001201682,0.07243079,0.0001666844,0.00003257662,0.0001694448,0.0000488183,0.00004394915,0.002358145],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006563062,"threshold_uncertainty_score":0.01379466,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01277884051352069,"score_gpt":0.2252136990534358,"score_spread":0.2124348585399151,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}