{"id":"W7124294995","doi":"10.65109/igaq8141","title":"Taming Multi-Agent Reinforcement Learning with Estimator Variance Reduction","year":2025,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Estimator; Variance (accounting); Reinforcement learning; Variance reduction; Range (aeronautics); Sample (material); Reduction (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004560668,0.0007856367,0.001111667,0.0003482927,0.0003649131,0.0007824766,0.001544683,0.0008052963,0.0008661831],"category_scores_gemma":[0.01888504,0.0004910502,0.0004278502,0.0002657662,0.001640815,0.001130099,0.002373534,0.002156613,0.0002703675],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007323341,"about_ca_system_score_gemma":0.001239496,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001423298,"about_ca_topic_score_gemma":0.001223506,"domain_scores_codex":[0.9976273,0.001239052,0.00008075033,0.0003133258,0.0005600324,0.0001795885],"domain_scores_gemma":[0.9871289,0.008266361,0.001334828,0.00218895,0.0008060102,0.0002751006],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002061876,0.0001284078,0.001335507,0.00008847651,0.00006189906,0.00008805026,0.0001654444,0.9079124,0.006528972,0.02776806,0.0006405411,0.05507606],"study_design_scores_gemma":[0.00001941153,0.00006274102,0.00008634109,0.000005088514,0.000004612684,0.00001178584,0.000004533879,0.993223,0.001461012,0.004868963,0.0002476807,0.000004893622],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01722221,0.00007606282,0.9811332,0.0001227316,0.00001848464,0.00002773331,0.000007762314,0.0005597481,0.0008321087],"genre_scores_gemma":[0.8518282,0.00006043799,0.1467623,0.0001507551,0.0000339513,0.000130174,0.0000246382,0.00009736924,0.0009121749],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004560668,"threshold_uncertainty_score":0.02411938,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01878255743847185,"score_gpt":0.2685703962063445,"score_spread":0.2497878387678727,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}