跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

OlmPool:小型架構選擇如何疊加破壞長上下文擴展

文章摘要

OlmPool是一個包含26個模型的受控套件,展示了即使訓練數據和擴展方法保持不變,小型架構選擇也可能疊加起來使長上下文擴展變得更加困難。

來源Ai2 Blog
OlmPool:小型架構選擇如何疊加破壞長上下文擴展
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

大多數語言模型都是在短文本序列上進行訓練的,然後通過額外的長文檔訓練(稱為上下文擴展)來處理更長的輸入。由於Llama 3的預訓練數據是專有的,很難判斷其擴展的易用性來自架構還是訓練數據。研究者假設相同的擴展方法可以遷移到其他架構,但OlmPool的研究表明,事實往往並非如此。

OlmPool是艾倫人工智能研究所(Ai2)開發的受控模型套件,包含26個7B模型,所有模型在相同數據上預訓練1400億個token,然後使用相同的長上下文數據混合和過程擴展到64K上下文。唯一變化的是架構。研究聚焦於四個影響注意力機制的架構選擇:QK歸一化、分組查詢注意力(GQA)、滑動窗口注意力和預訓練上下文長度。

研究發現,這些選擇單獨作用時影響温和:QK歸一化影響最大,移除它並切換歸一化順序可在HELMET基準上帶來6分提升;GQA和較短的預訓練上下文長度各自造成較小下降;滑動窗口注意力單獨影響約1分。但當它們組合時,效果遠超各部分之和——例如,在已有GQA的模型上添加滑動窗口注意力平均導致9分下降。最差的配置組合了兩種或更多限制注意力靈活性的選擇。

更關鍵的是,標準訓練信號幾乎無法預測長上下文性能。訓練損失、驗證困惑度和16個短上下文基準都無法識別哪些模型在32K或64K上下文中表現更好。即使在同一基準的8K分割上,分數也無法預測擴展後兩位數的波動。擴展後表現看似相同的模型,在HELMET上可能相差26分以上。

研究還發現,Llama 3的架構組合表現強勁,但並非在所有情況下最優——其他幾種模型明顯超越它。這表明Llama 3的長上下文成功主要源於架構,驗證於Llama的擴展方法可能需要針對其他模型族進行調整。此外,架構導致的差距不會隨着更多數據而消失:即使經過500億token的上下文擴展(佔訓練總量的26%),最差架構仍無法達到Llama架構在10億token後的性能。

注意力模式分析揭示了原因:沒有QK歸一化的模型會產生更強的注意力匯聚——輸入早期位置持續獲得大量關注,即使它們與當前預測無關。更強的匯聚與更好的長上下文表現相關,表明它是模型在沒有QK歸一化時支持長距離檢索的默認策略。在針在該測試中,有QK歸一化的模型對目標信息的關注度較低,與其較弱的長上下文表現一致。

OlmPool套件已完整發布,包含所有26個模型在預訓練和上下文擴展各階段的38個檢查點。這項研究強調,架構選擇的組合可能產生遠低於預期的長上下文性能,且這種結果無法從標準訓練信號中預知。研究者希望該資源能幫助開發更好的上下文擴展方法,並研究早期預訓練中的其他現象。

展開要點與分析

文章情報

工程師進階

要點

  • 四種架構選擇(QK歸一化、分組查詢注意力、滑動窗口注意力、預訓練上下文長度)各自影響較小,但組合起來可導致長上下文性能下降高達47%。
  • 標準訓練指標無法預測長上下文性能;在標準評估中看似相同的模型在擴展後可能相差26分以上。
  • Llama 3的長上下文成功主要歸功於架構,但它並非總是最優;其他配置可以超越它。
  • 即使增加數據量,架構導致的差距也不會消失,注意力模式(注意力匯聚)有助於解釋差異。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。