{"id":"W7124242323","doi":"10.65109/kkdn1922","title":"Dynamic Reward Sharing to Enhance Learning in the Context of Multiagent Teams","year":2025,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Reinforcement learning; Process (computing); Context (archaeology); Function (biology); Social learning; Hyperparameter; Policy learning","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002251573,0.000751238,0.0009333912,0.0003351746,0.0005352599,0.0008456463,0.001339219,0.0008337271,0.00164077],"category_scores_gemma":[0.008614484,0.0003211997,0.0003868015,0.0002467002,0.00138948,0.001814419,0.002526395,0.001272717,0.0002699904],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0008328573,"about_ca_system_score_gemma":0.0009876982,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001010909,"about_ca_topic_score_gemma":0.001059653,"domain_scores_codex":[0.9988244,0.0005719948,0.00004231321,0.0002297899,0.0001911725,0.0001403391],"domain_scores_gemma":[0.996886,0.001666064,0.0005201778,0.00033432,0.0002464812,0.0003470757],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001244782,0.0002258727,0.001546283,0.00006991807,0.00006348555,0.0001359661,0.0002584044,0.9041966,0.005588043,0.03738695,0.0007234286,0.04968053],"study_design_scores_gemma":[0.00002385036,0.00008578571,0.0002005333,0.000007391281,0.000009781497,0.00002053224,0.00002006168,0.9728959,0.001000061,0.02522963,0.000498494,0.000008051643],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08550436,0.00027412,0.9096841,0.0003685293,0.00004684617,0.00007362343,0.00001895112,0.0002995264,0.003729944],"genre_scores_gemma":[0.9578387,0.00006459819,0.04083228,0.00007285503,0.00002281114,0.00006957135,0.0000123147,0.00003393128,0.001053044],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.002251573,"threshold_uncertainty_score":0.01190764,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01162814992993511,"score_gpt":0.3019428447322766,"score_spread":0.2903146948023415,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}