{"id":"W7124242323","doi":"10.65109/kkdn1922","title":"Dynamic Reward Sharing to Enhance Learning in the Context of Multiagent Teams","year":2025,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Reinforcement learning; Process (computing); Context (archaeology); Function (biology); Social learning; Hyperparameter; Policy learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002532797,0.0003300474,0.000461401,0.0004399323,0.0002941357,0.0003589189,0.003301558,0.0001327624,0.00008380367],"category_scores_gemma":[0.001059471,0.000271906,0.000150141,0.001940907,0.0001169386,0.0003231716,0.001666722,0.001129886,0.0001430721],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002966067,"about_ca_system_score_gemma":0.0002348337,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0005445102,"about_ca_topic_score_gemma":0.0002136678,"domain_scores_codex":[0.9962425,0.000403359,0.001125374,0.0008530189,0.0006706087,0.0007051038],"domain_scores_gemma":[0.9973983,0.0007066629,0.0003118269,0.001321404,0.0001788098,0.00008298067],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00002124366,0.00006916041,0.007085849,0.0001257308,0.000039961,0.000009034427,0.02258767,0.8860733,0.0009862054,0.008660826,0.000165804,0.07417521],"study_design_scores_gemma":[0.0003216967,0.0002695351,0.005288015,0.0007253216,0.00001683465,0.000001680818,0.005759508,0.9816895,0.002403854,0.0000561059,0.003202646,0.0002653555],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.05735659,0.0002326617,0.9239774,0.003932325,0.0007388925,0.0008483838,3.107948e-7,0.00007052319,0.0128429],"genre_scores_gemma":[0.9628615,0.00009542006,0.01164033,0.001935419,0.00001232832,0.0000304371,0.00000129343,0.0000132544,0.02341002],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9123371,"threshold_uncertainty_score":0.9999733,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01162814992993511,"score_gpt":0.3019428447322766,"score_spread":0.2903146948023415,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}