{"id":"W4389665442","doi":"10.1109/iros55552.2023.10342281","title":"Asynchronous, Option-Based Multi-Agent Policy Gradient: A Conditional Reasoning Approach","year":2023,"lang":"en","type":"article","venue":"","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Huawei Technologies (Canada); Simon Fraser University","funders":"","keywords":"Asynchronous communication; Computer science; Action (physics); State (computer science); Artificial intelligence; Machine learning; Algorithm","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00380785,0.001061407,0.001251565,0.0008160418,0.0006778674,0.001213343,0.003059263,0.001633724,0.003994846],"category_scores_gemma":[0.008180939,0.0006841342,0.0008907269,0.0005812105,0.001589207,0.002050728,0.001994362,0.002335225,0.0005352071],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001483571,"about_ca_system_score_gemma":0.002615589,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005149842,"about_ca_topic_score_gemma":0.004971393,"domain_scores_codex":[0.9986567,0.0004952818,0.00007084642,0.0002510115,0.0003837504,0.0001424287],"domain_scores_gemma":[0.9955129,0.002976953,0.0003874021,0.000289786,0.0005428832,0.0002899928],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001444027,0.00008779727,0.0007020289,0.00009248219,0.0000472767,0.0001302787,0.0001153777,0.9159421,0.001429186,0.03794435,0.001432097,0.04193249],"study_design_scores_gemma":[0.0000123306,0.00001360415,0.00003888029,0.000004650426,0.000004530685,0.000008393222,0.000004252472,0.9923027,0.0002255509,0.007167163,0.0002133204,0.00000472841],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.008815111,0.000131798,0.9880802,0.0002930995,0.00002992088,0.00006345919,0.00005454698,0.0004696993,0.002062224],"genre_scores_gemma":[0.708443,0.0001476418,0.2881047,0.0003034717,0.00006781906,0.0002178471,0.0001617169,0.0001436788,0.002410144],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.005149842,"threshold_uncertainty_score":0.02013803,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03117581096845054,"score_gpt":0.282744969442382,"score_spread":0.2515691584739315,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}