AI News HubLIVE
站內改寫2 分鐘閱讀

循環變壓器中的自適應深度:診斷學習暫停門與軌跡讀取

該研究通過軌跡-讀取視角分析循環變壓器的自適應深度問題,發現固定先驗深度監督能產生難度感知軌跡,且簡單的後驗置信度讀取器常優於學習門控。實驗表明,聯合門訓練導致的軌跡問題是性能瓶頸,而非門控表達能力不足。

來源arXiv Machine Learning作者: Andrei Cristian Popescu, Haitz S\'aez de Oc\'ariz Borde, Pietro Li\`o

近日,arXiv上發佈了一項關於循環變壓器(Looped Transformers)自適應深度的重要研究,論文編號為2607.20519。該研究由Andrei Cristian Popescu等人完成,系統診斷了循環變壓器中學習暫停門與軌跡讀取之間的相互作用。循環變壓器通過重複應用共享循環塊來增加測試時的計算量,這使得它們能夠在推理時動態調整計算深度。然而,學習暫停目標通常使用單一的退出分佈,既作為推理時的停止規則,又作為訓練時各深度損失的權重。這種設計將退出選擇與軌跡形成緊密糾纏:門控不僅決定使用哪個循環狀態,還決定了每個中間狀態被監督的強度。因此,自適應計算性能不佳可能源於讀取器、誘導軌跡或兩者的交互作用,而傳統方法往往只關注門控本身。

為了深入探究這一問題,研究者從軌跡-讀取視角出發,在模塊化算術、二進制奇偶性等合成任務以及大規模Ouro-1.4B和2.6B檢查點上進行了系統診斷。合成任務允許精確控制難度,而大規模模型則檢驗發現的泛化能力。他們發現,採用固定先驗深度監督(即不依賴輸入暫停策略來塑造軌跡)能夠產生具有難度感知的軌跡,這些軌跡的中間狀態暴露了有用的停止信號。例如,在二進制奇偶性任務中,簡單任務狀態在早期就顯示出高置信度,而複雜任務則延遲。同時,簡單的後驗置信度讀取器往往能夠匹配甚至超越學習得到的線性門控和MLP門控。這一發現表明,門控的表達能力並非主要限制因素。

通過在凍結軌跡上擬合門控,研究者定位了失敗原因:主要來自聯合門訓練誘導的軌跡問題,而非門控表達能力不足。具體來説,當門控與軌跡共同訓練時,它們相互影響,導致軌跡無法有效反映任務難度。而在固定軌跡上訓練門控,則能輕鬆達到良好性能。在Ouro評估中,研究者觀察到了相同的模式。預訓練的暫停門雖然具有競爭力,但並非均勻的帕累托最優。實測延遲證實,平均退出深度的減少能夠轉化為實際的推理時間節省,這對於部署具有重要意義。

這項工作將自適應深度重新定義為軌跡形成與退出讀取的聯合問題,而不僅僅是門控學習,強調了先前研究經常忽略的這一關鍵區別。該發現對於模型選型、推理成本優化以及產品能力提升具有重要意義,併為未來設計更高效的自適應計算機制提供了新方向。