大型語言模型的卷積方法
該研究探討了在大型語言模型(LLM)中引入輕量級深度可分離卷積,以增強區域性token互動。透過在Qwen3 Transformer塊的17個位置進行消融實驗,發現最佳位置是在注意力之前對投影的查詢、鍵和值應用卷積。微觀研究進一步確定了一個殘差深度可分離卷積,核大小k=3,無需額外的歸一化或啟用。在多個Qwen3模型和預訓練資料預算下,該設計在七個下游基準測試中平均準確率有所提升,而引數增加不到0.01%。案例分析表明,卷積使重複的token ID對其直接上下文更加敏感。這些結果支援深度可分離卷積作為自注意力的輕量級補充,用於建模短程token互動。
大型語言模型(LLM)目前主要基於Transformer架構,其中自注意力機制負責捕獲全域性token之間的依賴關係。然而,自然語言中固有的區域性性特徵(例如相鄰詞之間的緊密聯絡)並未被自注意力顯式編碼。一項由Yuchuan Tian等10位研究者提交至arXiv的新工作(論文編號2607.18413,提交於2026年7月20日)系統研究了能否透過輕量級深度可分離卷積為LLM提供這種區域性歸納偏置,同時不顯著增加模型尺寸。
研究團隊以Qwen3 Transformer塊為測試平臺,進行了宏觀層面的消融實驗。他們在塊內部的17個不同位置插入卷積操作,對比各個位置對下游任務的影響。實驗結果表明,將卷積應用於投影后的查詢、鍵和值(QKV)且位於注意力計算之前,能夠取得最佳效果。在此基礎上,團隊進一步進行了微觀層面的設計空間探索,最終確定的最佳化方案是一個殘差深度可分離卷積,其核大小為3,且不附加額外的歸一化層或啟用函式。
為了驗證該設計的通用性,研究者將其整合到不同規模的Qwen3模型中,並採用多種預訓練資料預算進行訓練。在七個涵蓋常識推理、文本分類等能力的下游基準測試上,該設計平均準確率均獲得提升,而引入的額外引數僅佔模型總引數的不到0.01%。此外,一項針對表示層的案例分析顯示,卷積使得重複出現的token ID對其直接上下文更加敏感,這直觀地說明了卷積增強了區域性資訊建模能力。
該研究為改進LLM的結構提供了一種簡潔而有效的思路:深度可分離卷積可以作為自注意力的輕量級補充,專門用於建模短距離token互動。這一發現有望在保持模型效率的同時,提升LLM在需要精細區域性理解的任務上的表現。