Muon最佳化器「頓悟」的有效成分
Muon最佳化器在模算術任務上比AdamW更快達到「頓悟」的現象曾被歸因於譜範數約束加正交化動量。本研究透過多種子多學習率掃描,系統分解並壓力測試各成分,發現加速完全來自正交化(Newton-Schulz迭代)。正交化最佳化器在約3倍更低的譜範數下泛化,並收斂到更低範數的解。減少Newton-Schulz迭代次數雖能加速但會降低解的魯棒性。研究還強調,在穩定性感知指標下,「更快」的宣告可能反轉,需同時報告首次穿越和持續頓悟時間。
Muon最佳化器在模算術任務上顯示出比AdamW更快的「頓悟」現象,引起了廣泛關注。先前的研究將其歸因於「譜範數約束加上正交化動量」,但未能明確哪個機制真正起作用。本研究透過多隨機種子和多學習率的系統掃描,分解並壓力測試了各個成分的效果,旨在揭示Muon加速的根本原因。
首先,消融實驗清晰地表明,加速效果完全來自正交化,即Newton-Schulz迭代。僅使用正交化即可達到與完整Muon相同的速度,而僅保留譜範數約束則與AdamW無異,甚至表現出不穩定性。這一結論在不同學習率下均成立,從而確認正交化是Muon加速的唯一有效成分。
其次,機制分析揭示了正交化如何帶來優勢。正交化最佳化器在達到泛化時,其譜範數約為AdamW的三分之一。在控制嵌入實際移動量的條件下,正交化最佳化器最終收斂到更低範數的解,而非僅僅減少擾動幅度。這表明正交化引導最佳化器進入一個更優的泛化區域。
第三,實驗還考察了Newton-Schulz迭代次數的影響。將迭代次數從五次減少到一次,可以更快地達到頓悟閾值,但得到的解變得脆弱且容易發生短暫崩潰。這種脆弱性隨學習率增加而增大;僅在很小的學習率下,單次迭代才能同時實現快速和穩定。而標準的五次迭代則在各種學習率下都表現出良好的魯棒性。此外,研究還發現譜縮放可以被移除而不帶來可測量的效能損失。
方法論上,本研究強調使用穩定性感知指標的重要性。在只考慮首次到達時間的標準下,「更快」的結論可能具有誤導性,因為某些最佳化器可能只是快速進入但無法穩定保持頓悟狀態。因此,作者同時報告了首次穿越時間和持續頓悟時間,以提供更全面的評估。為了支援可重複性,完整的訓練和分析程式碼已在GitHub上開源。