{"id":"W4212802944","doi":"10.3390/s22041393","title":"Multi-Agent Reinforcement Learning via Adaptive Kalman Temporal Difference and Successor Representation","year":2022,"lang":"en","type":"article","venue":"Sensors","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":6,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto; Concordia University","funders":"Natural Sciences and Engineering Research Council of Canada; Ministère de la Défense Nationale","keywords":"Reinforcement learning; Overfitting; Computer science; Kalman filter; Artificial intelligence; Temporal difference learning; Representation (politics); Inefficiency; Machine learning; Artificial neural network","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001031444,0.0006218022,0.0007878735,0.0002866091,0.000288074,0.0005984633,0.001219297,0.0007253457,0.001052766],"category_scores_gemma":[0.002744993,0.0002555618,0.0003599274,0.000263154,0.0007126161,0.0007643867,0.0009152505,0.001024283,0.0001519453],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0005932644,"about_ca_system_score_gemma":0.0009511662,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004789925,"about_ca_topic_score_gemma":0.003718699,"domain_scores_codex":[0.9995444,0.0001339351,0.00002731237,0.000110849,0.0001254199,0.00005797555],"domain_scores_gemma":[0.9988779,0.0006082627,0.0001960731,0.00008021341,0.0001656704,0.00007177088],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00007034266,0.00005250395,0.0007558353,0.00005162921,0.00002862057,0.00006394555,0.00004530943,0.9460191,0.001546039,0.0105631,0.0005546774,0.04024896],"study_design_scores_gemma":[0.000005043099,0.00001564788,0.00003751005,0.000001653577,0.00000204935,0.000005519162,0.000001708249,0.9985145,0.0001762967,0.00111593,0.0001222241,0.000001945185],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02388302,0.0002368567,0.9731787,0.0001571079,0.00004247012,0.00003249358,0.00002579635,0.0003578955,0.002085672],"genre_scores_gemma":[0.9396926,0.0001037145,0.05877553,0.0000647347,0.00002062404,0.00008096314,0.00004359494,0.00002013457,0.001198001],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004789925,"threshold_uncertainty_score":0.009524047,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03640443974414519,"score_gpt":0.2723738731078577,"score_spread":0.2359694333637125,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}