{"id":"W4361273506","doi":"10.3390/systems11040180","title":"It’s All about Reward: Contrasting Joint Rewards and Individual Reward in Centralized Learning Decentralized Execution Algorithms","year":2023,"lang":"en","type":"article","venue":"Systems","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"Mitacs","keywords":"Reinforcement learning; Variance (accounting); Computer science; Joint (building); Function (biology); Foraging; Machine learning; Artificial intelligence; Value (mathematics); Engineering","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.007112126,0.0005548114,0.001280402,0.0004488679,0.0005914185,0.001755722,0.0009912825,0.001230931,0.001057821],"category_scores_gemma":[0.03776397,0.0002805055,0.0003450735,0.0004463707,0.00217362,0.003111038,0.001970701,0.001860894,0.0001479448],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001324698,"about_ca_system_score_gemma":0.001311509,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001584605,"about_ca_topic_score_gemma":0.001567131,"domain_scores_codex":[0.9963246,0.002297585,0.0001154808,0.0003994129,0.000602293,0.0002606801],"domain_scores_gemma":[0.9661827,0.02850111,0.001852228,0.001239702,0.001334346,0.0008899791],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0007374689,0.0003248152,0.00492134,0.0001978694,0.0001130481,0.00007088216,0.0003198493,0.8310218,0.002631399,0.0733522,0.000654518,0.08565481],"study_design_scores_gemma":[0.00006459595,0.0003900673,0.00135127,0.00003143322,0.0000258482,0.00002554762,0.00007087715,0.9444976,0.001110555,0.05201351,0.0003980694,0.00002065613],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.2742545,0.001007148,0.7154416,0.001719787,0.00009896574,0.0001055464,0.00002569032,0.0002463571,0.007100307],"genre_scores_gemma":[0.9637846,0.0001331064,0.03532061,0.0001107083,0.00003543324,0.00003790878,0.00001108572,0.00003883279,0.000527721],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007112126,"threshold_uncertainty_score":0.03761297,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06219908550440429,"score_gpt":0.2892080950814729,"score_spread":0.2270090095770686,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}