{"id":"W4385763897","doi":"10.24963/ijcai.2023/776","title":"Multi-Agent Advisor Q-Learning (Extended Abstract)","year":2023,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; Vector Institute; University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; University of Waterloo; Mitacs; University of Alberta; Alberta Machine Intelligence Institute; Compute Canada; Government of Canada; Vector Institute; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Computer science; Variety (cybernetics); Sample complexity; Artificial intelligence; Heuristic; Action (physics); Convergence (economics); Software deployment; Q-learning; Point (geometry); Operations research; Machine learning; Software engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002200889,0.001024292,0.001045312,0.0004061206,0.0004245455,0.0008765646,0.001726653,0.00146501,0.01578618],"category_scores_gemma":[0.007990451,0.0003276895,0.0004869409,0.0006555266,0.0007979852,0.001027752,0.001574631,0.001904328,0.002090746],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007746654,"about_ca_system_score_gemma":0.001474703,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004466181,"about_ca_topic_score_gemma":0.004927696,"domain_scores_codex":[0.999167,0.0003451808,0.00003763406,0.0001828804,0.0001640033,0.0001033822],"domain_scores_gemma":[0.9971572,0.001705107,0.0001860594,0.0003051321,0.0004703205,0.0001761713],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002750125,0.0002231079,0.001323172,0.0002255842,0.0000583814,0.0001436679,0.00009065584,0.7277113,0.0008822347,0.03237389,0.01183344,0.2248597],"study_design_scores_gemma":[0.00003671004,0.00003888158,0.00007803116,0.00001152582,0.00000447992,0.00001876092,0.000004655294,0.9881116,0.0003550309,0.0095619,0.001773756,0.000004768723],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.007033331,0.0003828689,0.9863657,0.0005047543,0.000130647,0.0001198754,0.0001115681,0.001075958,0.004275327],"genre_scores_gemma":[0.5350832,0.0004188907,0.4494841,0.0008417617,0.0002842519,0.0005284136,0.0005562437,0.0002941201,0.01250907],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01578618,"threshold_uncertainty_score":0.05281001,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03721342908507978,"score_gpt":0.288069363828437,"score_spread":0.2508559347433572,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}