通过全循环Transformer简单稳定循环
全循环Transformer通过两种无参数修改——全循环架构和注意力注入——解决了循环Transformer训练不稳定的问题,实现了最多12次循环迭代的稳定训练,并提升下游任务性能高达13.2%,同时允许在推理时灵活调整计算预算。
在机器学习领域,扩大模型规模通常需要增加参数数量。然而,循环Transformer提供了一种有吸引力的替代方案:通过迭代复用相同的Transformer块,以额外计算换取性能提升,而不增加参数数量或上下文长度。由于推理时可调整循环次数,它还能自然地在性能和测试时计算之间取得平衡。但循环Transformer在循环次数增加时面临训练不稳定问题。
研究人员分析发现,这种不稳定性源于两个原因:梯度振荡和残差爆炸。为解决这些问题,他们提出了全循环Transformer,引入了两种无参数修改:第一,全循环架构,将循环间信号分布到所有层以缓解残差爆炸;第二,注意力注入,重用现有注意力块来抑制梯度振荡。这些修改稳定了训练动态,使全循环Transformer能在多达12次循环迭代下稳定训练,而其他基线循环模型在此情况下崩溃。
在较温和的设置下(循环Transformer未崩溃时),全循环Transformer仍能将平均下游任务性能提升高达13.2%。实验表明,全循环Transformer提高了训练稳定性,增强了下游性能,并通过在推理时改变循环次数,提供了在不同测试时计算预算下的初步适应性。这项研究为高效利用计算资源提供了新思路,有望推动循环架构在实际应用中的部署。论文由Rao Fu、Zixuan Yang、Jiankun Zhang、Jing Ma、Hechang Chen、Yu Li和Yi Chang共同撰写,于2026年5月11日提交至arXiv,编号为2605.18797。该工作隶属于机器学习领域,并涉及人工智能。全循环Transformer的核心贡献在于无需额外参数即可稳定训练,这对于实际部署循环模型具有重要意义。未来的工作可能包括探索更深的循环次数、结合其他架构以及优化注意力注入机制。总之,这项研究通过简单有效的修改,使得循环Transformer的训练变得稳定且高效,为计算资源受限场景下的模型设计提供了新方向。