{"id":"W4416177363","doi":"10.48550/arxiv.2508.06836","title":"Multi-level Advantage Credit Assignment for Cooperative Multi-Agent Reinforcement Learning","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Alliance de recherche numérique du Canada","keywords":"Counterfactual thinking; Reinforcement learning; Key (lock); Diversity (politics); Function (biology)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003051111,0.0009003673,0.001167844,0.0006781611,0.000508724,0.0009999932,0.001863553,0.001147152,0.002073754],"category_scores_gemma":[0.008932659,0.0004700072,0.0005720793,0.0005344012,0.001665178,0.001506277,0.001932346,0.002090973,0.000230403],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001804929,"about_ca_system_score_gemma":0.001606911,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003272984,"about_ca_topic_score_gemma":0.00342911,"domain_scores_codex":[0.9986332,0.0005980306,0.00006501049,0.0002534084,0.000305298,0.0001449907],"domain_scores_gemma":[0.9956975,0.002675413,0.000481415,0.0004044086,0.000402314,0.0003389417],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009587867,0.0000903922,0.001805904,0.00006352387,0.00005923318,0.00007730371,0.000118689,0.9215658,0.001148582,0.03590421,0.0008150208,0.03825545],"study_design_scores_gemma":[0.000005957734,0.00001155031,0.00005855501,0.000002338736,0.00000337162,0.00000484134,0.000002905703,0.9883446,0.0001145409,0.01133941,0.0001092575,0.000002751802],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02204557,0.0001274287,0.9758839,0.000260638,0.0000266336,0.00005118024,0.00002502393,0.0002805027,0.001299092],"genre_scores_gemma":[0.8914877,0.00007377663,0.1067857,0.0001347435,0.00003935249,0.0001285354,0.00004146296,0.00005213378,0.001256573],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.003272984,"threshold_uncertainty_score":0.01613605,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1193564411615443,"score_gpt":0.3388184746199345,"score_spread":0.2194620334583902,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}