{"id":"W4385763897","doi":"10.24963/ijcai.2023/776","title":"Multi-Agent Advisor Q-Learning (Extended Abstract)","year":2023,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Vector Institute; University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; University of Waterloo; Mitacs; University of Alberta; Alberta Machine Intelligence Institute; Compute Canada; Government of Canada; Vector Institute; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Computer science; Variety (cybernetics); Sample complexity; Artificial intelligence; Heuristic; Action (physics); Convergence (economics); Software deployment; Q-learning; Point (geometry); Operations research; Machine learning; Software engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0003935324,0.000139431,0.0001240671,0.0001733805,0.0001857368,0.0002132696,0.0008013536,0.00005838366,0.0001876384],"category_scores_gemma":[0.0001773065,0.0001261713,0.00007316285,0.0006307694,0.00002455002,0.000360475,0.0004364724,0.0002696227,0.006020296],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0000386729,"about_ca_system_score_gemma":0.00004121399,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00001662455,"about_ca_topic_score_gemma":0.000001707868,"domain_scores_codex":[0.9985472,0.00003476228,0.000256207,0.0003463364,0.0003793199,0.0004361527],"domain_scores_gemma":[0.9991485,0.0001252656,0.00009038742,0.000462287,0.00005859256,0.000114969],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000001524579,0.00002408379,0.0009200611,0.00001671847,0.00002185464,0.0000510785,0.0006659547,0.9718513,0.001857918,0.006046646,0.004909544,0.01363335],"study_design_scores_gemma":[0.0002768461,0.00005089394,0.03952098,0.00001022927,0.000002262924,0.00000358496,0.00008863756,0.929755,0.0004804793,0.00004509867,0.02958637,0.0001796704],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003271679,0.000009575539,0.9802254,0.0007321271,0.0004931325,0.0001377287,1.29047e-7,0.001966208,0.01316395],"genre_scores_gemma":[0.8279019,0.00003788574,0.1073093,0.0003152392,0.0000583399,0.00001582379,0.000008738451,0.00002289497,0.0643299],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.8729162,"threshold_uncertainty_score":0.9947537,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03721342908507978,"score_gpt":0.288069363828437,"score_spread":0.2508559347433572,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}