混合架構正在成為大模型發展的重要方向,但如何在全注意力與線性注意力之間分配角色,目前仍主要依賴經驗式設計。一篇由Runlin Shi等人撰寫、發佈於arXiv的論文提出了一個新視角:現代Transformer本身已經隱含地完成了這種功能分化,研究者只需要用干預手段把它揭示出來,就能把混合架構的設計從啓發式推進為有據可依的原則。
論文的核心觀察來自對RoPE(旋轉位置編碼)Transformer的頭部級分析。傳統的行為學探針往往只能把注意力頭粗略劃分為若干類型,難以形成完整的分類體系。為了克服這一侷限,作者設計了兩種干預指標。第一種是RoPE頻率重要性分數(RFIS),用於衡量每個旋轉頻率對某個注意力頭分佈的影響;第二種是RoPE位置依賴度(RPD),用來剝離注意力頭對旋轉位置調製的依賴程度。RFIS給出初步信號,RPD則驗證這一信號,二者結合可以在Qwen3系列和Llama3.1模型上得到一套清晰的二分法:檢索頭與位置頭。
更有意思的是,這兩類頭部之間並不存在模糊的連續譜,而是被一個顯著的“中低頻帶”明確隔開。研究者進一步在可控Transformer實驗中看到,這個分界線的位置隨着訓練序列的長度尺度的改變而移動。他們把這個界帶稱為“全局位置帶”(Global Positional Band)。這一發現可能解釋了為什麼許多模型無法在零樣本條件下做長度外推:當模型將遠距離的依賴關係寄希望於位置編碼,而位置編碼的全局尺度又被訓練長度所限定時,外推就會失效。
基於這些證據,論文提煉出兩條架構原則。其一,位置建模應當侷限在局部範圍內運行,而全局信息訪問則需要依賴與位置無關的檢索機制來實現。其二,這兩種功能應分配到頭部粒度上,並採用分層特異性的分配方式,而不是在整個層或整個模型上做粗粒度切分。換句話説,理想的狀態不是讓某些層做全局注意力、某些層做線性注意力,而是在同一層內讓不同的頭各司其職。
為了驗證這些原則,作者構造了“頭級混合架構”(HwH)。HwH將不攜帶位置編碼的全注意力(NoPE FA)用於全局檢索,將線性注意力(LA)用於局部位置建模。實驗顯示,即使FA與LA的比例低於1:3,HwH也能保持較強的語言建模與常識推理能力,同時檢索性能得到提升,零樣本長上下文外推顯著優於普通Transformer、純線性注意力和分層混合基線。
消融實驗進一步確認了全局位置帶與兩條設計原則各自的作用,説明“檢索頭”和“位置頭”的角色分配確實是架構性能的關鍵。這項研究的意義不僅在於給出了一個新的混合架構方案,更在於示範了一條從模型內部分析出發、逐步得出可遷移設計原則的路徑。論文全文包括24頁正文、15張圖和8張表,可在arXiv上以編號2609.02986查閲。