{"id":"W7124285129","doi":"10.65109/vyhj2561","title":"Dual Ensembled Multiagent Q-Learning with Hypernet Regularizer","year":2025,"lang":"","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal","funders":"","keywords":"Dual (grammatical number); Process (computing); Reinforcement learning; Computation; Multi-agent system","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","scholarly_communication"],"consensus_categories":[],"category_scores_codex":[0.0008309105,0.0006364456,0.0006054567,0.0004178179,0.0006943411,0.001143963,0.001231223,0.0002899343,0.0007494005],"category_scores_gemma":[0.0002694027,0.0005427614,0.0001751514,0.001560131,0.0002542087,0.0006302554,0.001297799,0.001127414,0.0005805035],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002211941,"about_ca_system_score_gemma":0.0006460168,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000114133,"about_ca_topic_score_gemma":0.00001262703,"domain_scores_codex":[0.9952829,0.0004119183,0.0008529451,0.001271421,0.001041191,0.001139619],"domain_scores_gemma":[0.9971499,0.0003664434,0.0003534387,0.001452867,0.0004161408,0.0002612225],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009001272,0.000099955,0.004123513,0.000110038,0.0003456634,0.0001288647,0.001255651,0.9280711,0.0007019554,0.04768251,0.002330831,0.01505994],"study_design_scores_gemma":[0.002079721,0.0006534036,0.00290254,0.0003608824,0.0001296242,0.00003594816,0.0002612837,0.9455129,0.002608935,0.00005982393,0.04473646,0.0006585016],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005304886,0.0002152031,0.8964873,0.001862329,0.001093471,0.0006174222,3.041038e-7,0.0004162312,0.09400284],"genre_scores_gemma":[0.6553407,0.0000738999,0.06336686,0.0009864426,0.00009003891,0.00001839967,0.000005623463,0.00003407471,0.280084],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8331205,"threshold_uncertainty_score":0.999893,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.009116201324229783,"score_gpt":0.2322789746532104,"score_spread":0.2231627733289806,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}