{"id":"W4389665442","doi":"10.1109/iros55552.2023.10342281","title":"Asynchronous, Option-Based Multi-Agent Policy Gradient: A Conditional Reasoning Approach","year":2023,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Huawei Technologies (Canada); Simon Fraser University","funders":"","keywords":"Asynchronous communication; Computer science; Action (physics); State (computer science); Artificial intelligence; Machine learning; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0003365418,0.0001635959,0.0001360072,0.0003870065,0.0002716495,0.0002131484,0.0006837245,0.00006239525,0.00003971551],"category_scores_gemma":[0.0001464908,0.0001557887,0.00009117073,0.001098212,0.0000623173,0.0002799257,0.0002117831,0.000154921,0.0007990986],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001814461,"about_ca_system_score_gemma":0.0002531043,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00006523596,"about_ca_topic_score_gemma":0.000001327431,"domain_scores_codex":[0.9983565,0.00006438993,0.0002492693,0.0004075024,0.0004625039,0.0004598761],"domain_scores_gemma":[0.9990777,0.0001054318,0.00009758392,0.0004943217,0.00007797981,0.0001469248],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[8.524951e-7,0.00002990528,0.0005123624,0.00001148441,0.00001224932,0.000005414562,0.0001531459,0.7261214,0.00003766807,0.2720405,0.0006936394,0.0003812737],"study_design_scores_gemma":[0.0005047382,0.00004643273,0.00653971,0.00001318696,0.000003304298,0.00000697237,0.00003368124,0.9907899,0.0001226664,0.0002985157,0.001452997,0.0001878184],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0007558363,0.000007329154,0.9911696,0.000735798,0.0001679711,0.0002112294,0.000002623507,0.0009323215,0.006017279],"genre_scores_gemma":[0.5901712,0.000004894121,0.4061818,0.0006326204,0.0001132231,0.00005515968,0.0001601003,0.00001715013,0.0026638],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.5894154,"threshold_uncertainty_score":0.9999789,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03117581096845054,"score_gpt":0.282744969442382,"score_spread":0.2515691584739315,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}