{"id":"W3210485068","doi":"10.1613/jair.1.13445","title":"Multi-Agent Advisor Q-Learning","year":2022,"lang":"en","type":"article","venue":"Journal of Artificial Intelligence Research","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":9,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta; University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada; University of Waterloo; Mitacs; University of Alberta; Alberta Machine Intelligence Institute; Compute Canada; Government of Canada; Vector Institute; Canadian Institute for Advanced Research","keywords":"Reinforcement learning; Computer science; Variety (cybernetics); Artificial intelligence; Action (physics); Heuristic; Sample complexity; Software deployment; Convergence (economics); Point (geometry); Operations research; Machine learning; Q-learning; Software engineering; Mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004377762,0.001350266,0.002130987,0.0006381302,0.0005977955,0.001041875,0.00263054,0.002106128,0.004974888],"category_scores_gemma":[0.01208623,0.000575283,0.0005638952,0.0006976401,0.001412677,0.001536838,0.001692592,0.002589334,0.0007651767],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00130721,"about_ca_system_score_gemma":0.002269601,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004467375,"about_ca_topic_score_gemma":0.004434816,"domain_scores_codex":[0.9983124,0.0007972575,0.00007962548,0.000346241,0.0002748095,0.0001898008],"domain_scores_gemma":[0.9921907,0.005717582,0.0004724927,0.0004063115,0.0007947746,0.000418114],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000246719,0.0002085163,0.001757385,0.0001327852,0.00006988092,0.00006862577,0.00009783855,0.8564205,0.0004480262,0.01869914,0.002530552,0.11932],"study_design_scores_gemma":[0.00002978515,0.00004048541,0.00004727066,0.00000701002,0.00000487901,0.000009918282,0.000005672277,0.9946773,0.0001601079,0.004612956,0.0004009098,0.000003777016],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01882364,0.0005116882,0.9764914,0.0005341831,0.00007576031,0.0001509172,0.00005458263,0.000747696,0.002610149],"genre_scores_gemma":[0.7388366,0.0002951897,0.2543772,0.0006875502,0.0001017221,0.0003318769,0.0002175454,0.0001295627,0.005022632],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.004974888,"threshold_uncertainty_score":0.02315211,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2234694362051712,"score_gpt":0.4278249643476039,"score_spread":0.2043555281424326,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}