{"id":"W7133070489","doi":"","title":"Optimizing Mechanism Design in Multi-Agent Reinforcement Learning","year":2024,"lang":"","type":"dissertation","venue":"TSpace","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Agencia Nacional de Investigación y Desarrollo; University of Toronto","keywords":"Reinforcement learning; Mechanism design; Markov decision process; Bridging (networking); Benchmark (surveying); Robustness (evolution); Mechanism (biology); Nash equilibrium","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication","research_integrity","insufficient_payload"],"consensus_categories":["metaepi_narrow"],"category_scores_codex":[0.002583739,0.001360088,0.00110303,0.001452626,0.0005575963,0.001636409,0.002141953,0.0008596551,0.0004577123],"category_scores_gemma":[0.0004978679,0.001544382,0.0004159232,0.001822035,0.000068947,0.0006754839,0.0009187731,0.00352808,0.002306651],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001267493,"about_ca_system_score_gemma":0.0008854385,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004231647,"about_ca_topic_score_gemma":0.00003719383,"domain_scores_codex":[0.9919261,0.0007220078,0.00177137,0.002056288,0.001759848,0.001764418],"domain_scores_gemma":[0.9965366,0.0004356048,0.00106323,0.001272082,0.0003077667,0.0003846775],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00005283628,0.00005025868,0.00000824873,0.0005932744,0.0001428666,0.0002751504,0.1174529,0.8716714,0.002077879,0.0063343,0.00009295632,0.001248023],"study_design_scores_gemma":[0.001043023,0.0006607447,0.00002537301,0.002758602,0.000148501,0.00001421794,0.01270916,0.9736016,0.006065597,0.0001099811,0.00143777,0.001425383],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0008509895,0.001319305,0.9856362,0.0002610211,0.005099535,0.00199362,1.946213e-7,0.0005011085,0.004338002],"genre_scores_gemma":[0.4432975,0.001722792,0.3009347,0.0001873479,0.0001899573,0.0003027874,0.0001666157,0.0003123234,0.252886],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.6847016,"threshold_uncertainty_score":0.999915,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06547687145312808,"score_gpt":0.3433784059699186,"score_spread":0.2779015345167905,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}