{"id":"W4416613133","doi":"10.48550/arxiv.2505.23725","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","year":2025,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Machine Learning in Materials Science","field":"Materials Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Fonds de recherche du Québec – Nature et technologies; Canada Excellence Research Chairs, Government of Canada; Compute Canada; Canadian Institute for Advanced Research","keywords":"Hyperparameter; Muon; Factor (programming language); Scale (ratio); Hyperparameter optimization; Language model; Synchronization (alternating current)","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.002184059,0.002854652,0.001321565,0.0006976298,0.0009482761,0.001883784,0.002614185,0.002214521,0.0183559],"category_scores_gemma":[0.008074004,0.001075483,0.001156505,0.0005686106,0.001062065,0.001882472,0.002609734,0.003925142,0.007946695],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001873326,"about_ca_system_score_gemma":0.003479181,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01429963,"about_ca_topic_score_gemma":0.03471245,"domain_scores_codex":[0.9988537,0.0003197526,0.00007338259,0.0003261052,0.0002427171,0.0001844601],"domain_scores_gemma":[0.9985669,0.0005384932,0.0000816782,0.0003189239,0.0003565095,0.0001375521],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001219966,0.000431814,0.004359644,0.0006963298,0.000325695,0.0004319758,0.0003443086,0.3793006,0.01048121,0.01835681,0.1971482,0.3869034],"study_design_scores_gemma":[0.0001080119,0.00007992243,0.0003263534,0.00003333287,0.00001658588,0.00005260696,0.00004355318,0.978938,0.004127249,0.003412897,0.01284028,0.00002113993],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.06202764,0.003190883,0.7863872,0.002336228,0.001664458,0.0005734162,0.002260203,0.1117475,0.02981234],"genre_scores_gemma":[0.2944079,0.0005473543,0.6576915,0.002703027,0.0003334323,0.0009486137,0.00619327,0.01272039,0.02445451],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.0183559,"threshold_uncertainty_score":0.06140661,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.08419056832393303,"score_gpt":0.2543852188979551,"score_spread":0.1701946505740221,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}