{"id":"W4378701136","doi":"10.1016/j.sysconle.2023.105563","title":"Approximated multi-agent fitted Q iteration","year":2023,"lang":"en","type":"article","venue":"Systems & Control Letters","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":false,"ca_institutions":"Polytechnique Montréal; Group for Research in Decision Analysis","funders":"","keywords":"Computation; Reinforcement learning; Mathematical optimization; Computer science; Mathematics; Function (biology); Property (philosophy); Applied mathematics; Algorithm; Artificial intelligence","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002134816,0.0008899668,0.002058997,0.0006872964,0.0007388195,0.001557357,0.001883382,0.002579929,0.005059967],"category_scores_gemma":[0.007973687,0.0007539575,0.0007750132,0.0005159727,0.001733361,0.001136023,0.001725584,0.001553101,0.0009712466],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001461576,"about_ca_system_score_gemma":0.002517725,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01108765,"about_ca_topic_score_gemma":0.006880278,"domain_scores_codex":[0.9992154,0.0002986837,0.00004122105,0.0001303471,0.0001704241,0.0001439251],"domain_scores_gemma":[0.996954,0.001834183,0.000181254,0.0001854803,0.0006615439,0.0001836279],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008165879,0.00002844593,0.0003383869,0.00004859065,0.00002204303,0.00005683656,0.00005532512,0.9780552,0.0003643316,0.009348861,0.0005272527,0.01107313],"study_design_scores_gemma":[0.000008326342,0.000009336584,0.00002079224,0.000003661905,0.000001764325,0.000004621292,0.000003690348,0.9983741,0.00006578264,0.001409488,0.00009634996,0.000001991988],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01497165,0.0001228784,0.9808726,0.0001757301,0.00006648818,0.0000508785,0.00003051326,0.0001970914,0.003512224],"genre_scores_gemma":[0.7243273,0.0001056561,0.2660237,0.0001834519,0.00004776856,0.0002850421,0.0001252425,0.000134587,0.008767319],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01108765,"threshold_uncertainty_score":0.02204621,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02177352513042629,"score_gpt":0.2416513473809132,"score_spread":0.2198778222504869,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}