{"id":"W4287586142","doi":"10.48550/arxiv.2011.14391","title":"Reinforcement Learning in Nonzero-sum Linear Quadratic Deep Structured\\n Games: Global Convergence of Policy Optimization","year":2020,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Energy, Environment, and Transportation Policies","field":"Energy","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Concordia University","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Reinforcement learning; Mathematical optimization; Mathematics; Convergence (economics); Nash equilibrium; Dimension (graph theory); Applied mathematics; Computer science; Mathematical economics; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001724794,0.001281257,0.001260368,0.000428056,0.0004423346,0.001011773,0.0009928927,0.001241713,0.001840632],"category_scores_gemma":[0.006847902,0.0004127113,0.0006277726,0.0003274697,0.001990676,0.001262493,0.001746417,0.001732277,0.000203921],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001459971,"about_ca_system_score_gemma":0.001511765,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008179651,"about_ca_topic_score_gemma":0.004505186,"domain_scores_codex":[0.9994044,0.000258773,0.00002006134,0.0001004534,0.00009803179,0.0001182429],"domain_scores_gemma":[0.9973336,0.001976254,0.0002444435,0.00007252953,0.0001995138,0.0001736505],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005196844,0.00003765545,0.0005344964,0.00005665046,0.00002669468,0.00006442313,0.00005358374,0.95599,0.0005978277,0.03759203,0.0004339883,0.004560622],"study_design_scores_gemma":[0.00000486651,0.000009868505,0.00002205381,0.000002477748,0.000001955245,0.000002950981,0.000004836958,0.9944583,0.00007119486,0.005354921,0.00006471438,0.000001750063],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08357015,0.0004646737,0.9071278,0.0008301467,0.00008872302,0.00007083999,0.00005627259,0.0001760736,0.0076154],"genre_scores_gemma":[0.9580991,0.0002768356,0.03705787,0.0002226088,0.00004101184,0.0001475386,0.00006425456,0.000053336,0.004037417],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.008179651,"threshold_uncertainty_score":0.01626408,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03199153908824146,"score_gpt":0.2008729139880276,"score_spread":0.1688813748997861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}