大型語言模型的卷積方法
該研究探討了在大型語言模型(LLM)中引入輕量級深度可分離卷積,以增強局部token交互。通過在Qwen3 Transformer塊的17個位置進行消融實驗,發現最佳位置是在注意力之前對投影的查詢、鍵和值應用卷積。微觀研究進一步確定了一個殘差深度可分離卷積,核大小k=3,無需額外的歸一化或激活。在多個Qwen3模型和預訓練數據預算下,該設計在七個下游基準測試中平均準確率有所提升,而參數增加不到0.01%。案例分析表明,卷積使重複的token ID對其直接上下文更加敏感。這些結果支持深度可分離卷積作為自注意力的輕量級補充,用於建模短程token交互。
大型語言模型(LLM)目前主要基於Transformer架構,其中自注意力機制負責捕獲全局token之間的依賴關係。然而,自然語言中固有的局部性特徵(例如相鄰詞之間的緊密聯繫)並未被自注意力顯式編碼。一項由Yuchuan Tian等10位研究者提交至arXiv的新工作(論文編號2607.18413,提交於2026年7月20日)系統研究了能否通過輕量級深度可分離卷積為LLM提供這種局部歸納偏置,同時不顯著增加模型尺寸。
研究團隊以Qwen3 Transformer塊為測試平台,進行了宏觀層面的消融實驗。他們在塊內部的17個不同位置插入卷積操作,對比各個位置對下游任務的影響。實驗結果表明,將卷積應用於投影后的查詢、鍵和值(QKV)且位於注意力計算之前,能夠取得最佳效果。在此基礎上,團隊進一步進行了微觀層面的設計空間探索,最終確定的優化方案是一個殘差深度可分離卷積,其核大小為3,且不附加額外的歸一化層或激活函數。
為了驗證該設計的通用性,研究者將其整合到不同規模的Qwen3模型中,並採用多種預訓練數據預算進行訓練。在七個涵蓋常識推理、文本分類等能力的下游基準測試上,該設計平均準確率均獲得提升,而引入的額外參數僅佔模型總參數的不到0.01%。此外,一項針對表示層的案例分析顯示,卷積使得重複出現的token ID對其直接上下文更加敏感,這直觀地説明了卷積增強了局部信息建模能力。
該研究為改進LLM的結構提供了一種簡潔而有效的思路:深度可分離卷積可以作為自注意力的輕量級補充,專門用於建模短距離token交互。這一發現有望在保持模型效率的同時,提升LLM在需要精細局部理解的任務上的表現。