{"id":"W4416198962","doi":"10.3390/sym17111951","title":"Dynamic Heterogeneous Multi-Agent Inverse Reinforcement Learning Based on Graph Attention Mean Field","year":2025,"lang":"en","type":"article","venue":"Symmetry","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Reinforcement learning; Ambiguity; Graph; Entropy (arrow of time); Principle of maximum entropy; Network topology; Inverse; Adversarial system","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00100447,0.0008883719,0.00119895,0.0006119026,0.0003888723,0.0007327453,0.001605466,0.0009992884,0.001253755],"category_scores_gemma":[0.003335388,0.0004309529,0.0006791205,0.0004085721,0.0009954703,0.001087685,0.001094309,0.001333739,0.0001793996],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001228246,"about_ca_system_score_gemma":0.001162487,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009166745,"about_ca_topic_score_gemma":0.005183702,"domain_scores_codex":[0.9994993,0.0001501891,0.0000198212,0.0001399234,0.000108465,0.00008238333],"domain_scores_gemma":[0.9988501,0.0006596617,0.0001455621,0.00007885744,0.0001759365,0.00008983911],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003771273,0.0000414969,0.0008504427,0.00003280491,0.0000393974,0.00006949317,0.00004524677,0.9600262,0.001145515,0.009301245,0.0006247619,0.0277857],"study_design_scores_gemma":[0.000003209297,0.000007612154,0.0000422811,0.000001304487,0.000002627706,0.000004922995,0.00000165345,0.9976391,0.00009470954,0.002132098,0.00006845041,0.00000219439],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02421929,0.0002217885,0.9734774,0.0002195797,0.00003538791,0.00003262837,0.000029103,0.0003184836,0.001446336],"genre_scores_gemma":[0.9338365,0.0001450342,0.06311361,0.0001953087,0.00003595031,0.0001071173,0.00009146291,0.00005225214,0.002422784],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009166745,"threshold_uncertainty_score":0.0182268,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01322704052998039,"score_gpt":0.2619231187260152,"score_spread":0.2486960781960348,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}