{"id":"W4416198962","doi":"10.3390/sym17111951","title":"Dynamic Heterogeneous Multi-Agent Inverse Reinforcement Learning Based on Graph Attention Mean Field","year":2025,"lang":"en","type":"article","venue":"Symmetry","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Reinforcement learning; Ambiguity; Graph; Entropy (arrow of time); Principle of maximum entropy; Network topology; Inverse; Adversarial system","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0003662376,0.0002370968,0.0001957312,0.0005305798,0.0002706599,0.000164818,0.0007076372,0.0001230362,0.00003649621],"category_scores_gemma":[0.0001654768,0.0002400045,0.0001835095,0.000712142,0.00003523261,0.000166255,0.0002720651,0.0004170209,0.0001528898],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002033345,"about_ca_system_score_gemma":0.00006558977,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00003807047,"about_ca_topic_score_gemma":0.00001152076,"domain_scores_codex":[0.9981419,0.0001320284,0.0003813526,0.0004861284,0.0004492575,0.0004092937],"domain_scores_gemma":[0.9987381,0.000169112,0.0001657575,0.0007584484,0.0000747771,0.00009383114],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001249588,0.00003892231,0.001815487,0.00004779155,0.00004131586,0.00001716298,0.00007335102,0.9920316,0.0002171582,0.00153838,0.0003320537,0.00383424],"study_design_scores_gemma":[0.0007204502,0.0002995591,0.000779907,0.0001265952,0.00001785361,0.000001577344,0.00003406226,0.9952741,0.001160177,0.00006131236,0.001303809,0.0002206281],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004859031,0.00002866371,0.9894789,0.0005414218,0.0009863592,0.0002784574,2.308179e-7,0.0003014595,0.003525469],"genre_scores_gemma":[0.9762488,0.0000177438,0.01595658,0.002468888,0.00001305609,0.00002009725,0.00001670851,0.00001456454,0.005243538],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9735223,"threshold_uncertainty_score":0.9787101,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01322704052998039,"score_gpt":0.2619231187260152,"score_spread":0.2486960781960348,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}