透過全迴圈Transformer簡單穩定迴圈
全迴圈Transformer透過兩種無引數修改——全迴圈架構和注意力注入——解決了迴圈Transformer訓練不穩定的問題,實現了最多12次迴圈迭代的穩定訓練,並提升下游任務效能高達13.2%,同時允許在推理時靈活調整計算預算。
在機器學習領域,擴大模型規模通常需要增加引數數量。然而,迴圈Transformer提供了一種有吸引力的替代方案:透過迭代複用相同的Transformer塊,以額外計算換取效能提升,而不增加引數數量或上下文長度。由於推理時可調整迴圈次數,它還能自然地在效能和測試時計算之間取得平衡。但迴圈Transformer在迴圈次數增加時面臨訓練不穩定問題。
研究人員分析發現,這種不穩定性源於兩個原因:梯度振盪和殘差爆炸。為解決這些問題,他們提出了全迴圈Transformer,引入了兩種無引數修改:第一,全迴圈架構,將迴圈間訊號分佈到所有層以緩解殘差爆炸;第二,注意力注入,重用現有注意力塊來抑制梯度振盪。這些修改穩定了訓練動態,使全迴圈Transformer能在多達12次迴圈迭代下穩定訓練,而其他基線迴圈模型在此情況下崩潰。
在較溫和的設定下(迴圈Transformer未崩潰時),全迴圈Transformer仍能將平均下游任務效能提升高達13.2%。實驗表明,全迴圈Transformer提高了訓練穩定性,增強了下游效能,並透過在推理時改變迴圈次數,提供了在不同測試時計算預算下的初步適應性。這項研究為高效利用計算資源提供了新思路,有望推動迴圈架構在實際應用中的部署。論文由Rao Fu、Zixuan Yang、Jiankun Zhang、Jing Ma、Hechang Chen、Yu Li和Yi Chang共同撰寫,於2026年5月11日提交至arXiv,編號為2605.18797。該工作隸屬於機器學習領域,並涉及人工智慧。全迴圈Transformer的核心貢獻在於無需額外引數即可穩定訓練,這對於實際部署迴圈模型具有重要意義。未來的工作可能包括探索更深的迴圈次數、結合其他架構以及最佳化注意力注入機制。總之,這項研究透過簡單有效的修改,使得迴圈Transformer的訓練變得穩定且高效,為計算資源受限場景下的模型設計提供了新方向。