SignMuon:通信高效的分布式Muon优化
SignMuon是一种结合了signSGD的多数表决符号聚合与Muon极坐标步骤的1位、矩阵感知优化器。每个工作节点通过牛顿-舒尔茨迭代计算动量极因子,传输元素级符号并由多数表决聚合。在频谱范数平滑和有界方差随机梯度下,实现了O(1/√T)的非凸收敛率。在330个CIFAR-10/ResNet-50配置上,SignMuon取得了最佳验证准确率92.15%;其4-GPU多数表决变体在匹配有效批次下训练时间减少37%。在nanoGPT上,SignMuon实现了更低的困惑度和更好的即时性能。
近日,一篇题为《SignMuon: Communication-Efficient Distributed Muon Optimization》的论文在arXiv上发布,提出了一种名为SignMuon的新型优化器,旨在解决大规模神经网络分布式训练中的通信瓶颈问题。该优化器融合了signSGD的多数表决符号聚合机制和Muon优化器的极坐标更新框架,实现了1比特的通信开销,同时保持了对权重张量矩阵结构的感知能力。
在分布式训练中,每个工作节点首先利用牛顿-舒尔茨迭代计算动量的极因子,从而获得类Muon的更新方向;然后仅传输每个元素的符号,并通过多数表决进行聚合。此外,还可以选择在本地执行额外的极坐标步骤,以进一步增强正交性,且不增加通信成本。
理论分析表明,在频谱范数平滑和有界方差随机梯度的条件下,该算法对于基于ℓ_1的平稳性度量能够达到O(1/√T)的非凸收敛速率。当噪声满足单峰对称分布时,M个工作节点的多数表决可将随机项降低1/√M,与signSGD的理论优势一致。在α-β模型中,分布式SignMuon每次迭代仅需一次整数和规约操作,所有正交化步骤均在本地完成,相比于float32实现了32倍的带宽减少(相对于int8为4倍)。
实验部分,研究者对330个CIFAR-10/ResNet-50配置进行了测试,SignMuon取得了最佳验证准确率92.15%;其4-GPU多数表决变体在匹配有效批次的情况下,达到92.02%的准确率,同时训练时间减少了37%。在nanoGPT语言模型上,SignMuon相比其他基于符号的基线方法取得了更低的困惑度和更优的即时性能,并在弱扩展实验中表现出色,最高可支持16个GPU。
该研究为分布式深度学习优化提供了新的思路,通过符号通信和矩阵感知更新显著降低了带宽需求,有望在大规模模型训练中得到广泛应用。