{"id":"W4399968983","doi":"10.1007/s44196-024-00560-2","title":"Multi-agent Gradient-Based Off-Policy Actor-Critic Algorithm for Distributed Reinforcement Learning","year":2024,"lang":"en","type":"article","venue":"International Journal of Computational Intelligence Systems","topic":"Adaptive Dynamic Programming Control","field":"Computer Science","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Wenzhou University; McGill University","keywords":"Reinforcement learning; Temporal difference learning; Generalization; Convergence (economics); Computer science; Stability (learning theory); Algorithm; Set (abstract data type); Rate of convergence; Mathematical optimization; Mathematics; Artificial intelligence; Machine learning; Key (lock)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001571435,0.000874219,0.001464313,0.0004962591,0.000395322,0.0007810173,0.001579514,0.001066806,0.002076878],"category_scores_gemma":[0.002873491,0.0004532482,0.0004427643,0.0003994381,0.0008974193,0.0006811932,0.001099464,0.001589547,0.0004376036],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008518958,"about_ca_system_score_gemma":0.001326035,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004708102,"about_ca_topic_score_gemma":0.002909812,"domain_scores_codex":[0.9994523,0.0001929745,0.00002698342,0.0000969805,0.0001627335,0.00006804929],"domain_scores_gemma":[0.9990055,0.0005202887,0.00009486161,0.00006031151,0.0002508564,0.00006824836],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007558585,0.00004702062,0.0003480651,0.00004846559,0.00003072369,0.00005180147,0.00003913493,0.9487655,0.001091264,0.008502521,0.0008752001,0.04012473],"study_design_scores_gemma":[0.000005910664,0.00000823023,0.00001368557,0.000001539269,0.000001320516,0.000003734809,9.220659e-7,0.9991395,0.00009241507,0.0006287626,0.0001027983,0.000001211811],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.00781761,0.0001764577,0.9898326,0.0001203151,0.00004821772,0.00003850765,0.00001073453,0.0002756673,0.001679766],"genre_scores_gemma":[0.8041418,0.0001901914,0.191049,0.0001582495,0.00005023736,0.0002370829,0.00007223088,0.00008519615,0.004015975],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004708102,"threshold_uncertainty_score":0.009361386,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02751854041541726,"score_gpt":0.3322516421591333,"score_spread":0.304733101743716,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}