{"id":"W7113916458","doi":"","title":"A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation","year":2025,"lang":"","type":"article","venue":"arXiv (Cornell University)","topic":"Reinforcement Learning in Robotics","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Huawei Technologies (Canada)","funders":"","keywords":"Asynchronous communication; Reinforcement learning; Overhead (engineering); Interpolation (computer graphics); Stability (learning theory); Speedup; Constraint (computer-aided design); Code (set theory)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.00140593,0.001105616,0.001161244,0.0004388558,0.0004442696,0.00116823,0.002203385,0.001566026,0.007809028],"category_scores_gemma":[0.007132455,0.0005940928,0.0006425936,0.0003982733,0.0009169399,0.001397001,0.002287273,0.002393393,0.002509542],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0009566694,"about_ca_system_score_gemma":0.002431641,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006000256,"about_ca_topic_score_gemma":0.007170806,"domain_scores_codex":[0.9993659,0.0001432631,0.00003411825,0.0001587134,0.0001885966,0.0001095086],"domain_scores_gemma":[0.9983936,0.0008742045,0.0001152371,0.0002791728,0.0002102754,0.0001275492],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002754807,0.0001484426,0.000903893,0.0001525325,0.00005109347,0.00008590673,0.0001109066,0.7953218,0.004179952,0.01016332,0.007722576,0.1808841],"study_design_scores_gemma":[0.0000148361,0.00001621223,0.00003161746,0.000004779094,0.000003290671,0.000008473169,0.000003984364,0.9966955,0.0006844793,0.001993032,0.00054099,0.000002880383],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.007199642,0.0001282684,0.9857916,0.0001956907,0.00007877844,0.00005028869,0.00006403212,0.004286797,0.002204998],"genre_scores_gemma":[0.5101306,0.0001508784,0.4788244,0.0006496824,0.0001131503,0.0003727209,0.0004243989,0.001155316,0.008178825],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.007809028,"threshold_uncertainty_score":0.02612382,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0748734437683085,"score_gpt":0.2104304695268579,"score_spread":0.1355570257585494,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}