AI News HubLIVE
站内改写1 分钟阅读

Muon优化器「顿悟」的有效成分

Muon优化器在模算术任务上比AdamW更快达到「顿悟」的现象曾被归因于谱范数约束加正交化动量。本研究通过多种子多学习率扫描,系统分解并压力测试各成分,发现加速完全来自正交化(Newton-Schulz迭代)。正交化优化器在约3倍更低的谱范数下泛化,并收敛到更低范数的解。减少Newton-Schulz迭代次数虽能加速但会降低解的鲁棒性。研究还强调,在稳定性感知指标下,「更快」的声明可能反转,需同时报告首次穿越和持续顿悟时间。

来源arXiv Machine Learning作者: Yufeng Wang

Muon优化器在模算术任务上显示出比AdamW更快的「顿悟」现象,引起了广泛关注。先前的研究将其归因于「谱范数约束加上正交化动量」,但未能明确哪个机制真正起作用。本研究通过多随机种子和多学习率的系统扫描,分解并压力测试了各个成分的效果,旨在揭示Muon加速的根本原因。

首先,消融实验清晰地表明,加速效果完全来自正交化,即Newton-Schulz迭代。仅使用正交化即可达到与完整Muon相同的速度,而仅保留谱范数约束则与AdamW无异,甚至表现出不稳定性。这一结论在不同学习率下均成立,从而确认正交化是Muon加速的唯一有效成分。

其次,机制分析揭示了正交化如何带来优势。正交化优化器在达到泛化时,其谱范数约为AdamW的三分之一。在控制嵌入实际移动量的条件下,正交化优化器最终收敛到更低范数的解,而非仅仅减少扰动幅度。这表明正交化引导优化器进入一个更优的泛化区域。

第三,实验还考察了Newton-Schulz迭代次数的影响。将迭代次数从五次减少到一次,可以更快地达到顿悟阈值,但得到的解变得脆弱且容易发生短暂崩溃。这种脆弱性随学习率增加而增大;仅在很小的学习率下,单次迭代才能同时实现快速和稳定。而标准的五次迭代则在各种学习率下都表现出良好的鲁棒性。此外,研究还发现谱缩放可以被移除而不带来可测量的性能损失。

方法论上,本研究强调使用稳定性感知指标的重要性。在只考虑首次到达时间的标准下,「更快」的结论可能具有误导性,因为某些优化器可能只是快速进入但无法稳定保持顿悟状态。因此,作者同时报告了首次穿越时间和持续顿悟时间,以提供更全面的评估。为了支持可重复性,完整的训练和分析代码已在GitHub上开源。