{"id":"W7113916458","doi":"","title":"A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation","year":2025,"lang":"","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Huawei Technologies (Canada)","funders":"","keywords":"Asynchronous communication; Reinforcement learning; Overhead (engineering); Interpolation (computer graphics); Stability (learning theory); Speedup; Constraint (computer-aided design); Code (set theory)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.000546371,0.0006704957,0.0006036521,0.0009490101,0.001197201,0.000827125,0.00193305,0.000316853,0.00005529207],"category_scores_gemma":[0.0001579945,0.0007608989,0.0001906238,0.004375091,0.0004285493,0.002439955,0.0009425215,0.0007999298,0.00006928833],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000996617,"about_ca_system_score_gemma":0.002537936,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001491801,"about_ca_topic_score_gemma":0.00005322274,"domain_scores_codex":[0.9959789,0.0003121369,0.0005875202,0.001600939,0.000309898,0.001210595],"domain_scores_gemma":[0.9970279,0.0002409652,0.00064211,0.001321227,0.0004881769,0.0002796207],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00008953986,0.000113217,0.005307314,0.0002456205,0.0001698302,0.000146771,0.001914802,0.7820057,0.00005541091,0.2025887,0.00002058769,0.007342479],"study_design_scores_gemma":[0.001980114,0.0006084113,0.001881697,0.0006014736,0.0001433793,0.0000163758,0.00179843,0.9906721,0.0003097614,0.000998419,0.0002335962,0.0007562589],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.08282388,0.00003666097,0.8995745,0.0003376148,0.0003702437,0.0008316012,0.000004828847,0.0003398835,0.01568084],"genre_scores_gemma":[0.9867979,0.0000573812,0.006971145,0.0002658757,0.000175833,0.000003197227,0.0000175765,0.00004290924,0.005668162],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9039741,"threshold_uncertainty_score":0.9994842,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0748734437683085,"score_gpt":0.2104304695268579,"score_spread":0.1355570257585494,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}