大型语言模型的卷积方法
该研究探讨了在大型语言模型(LLM)中引入轻量级深度可分离卷积,以增强局部token交互。通过在Qwen3 Transformer块的17个位置进行消融实验,发现最佳位置是在注意力之前对投影的查询、键和值应用卷积。微观研究进一步确定了一个残差深度可分离卷积,核大小k=3,无需额外的归一化或激活。在多个Qwen3模型和预训练数据预算下,该设计在七个下游基准测试中平均准确率有所提升,而参数增加不到0.01%。案例分析表明,卷积使重复的token ID对其直接上下文更加敏感。这些结果支持深度可分离卷积作为自注意力的轻量级补充,用于建模短程token交互。
大型语言模型(LLM)目前主要基于Transformer架构,其中自注意力机制负责捕获全局token之间的依赖关系。然而,自然语言中固有的局部性特征(例如相邻词之间的紧密联系)并未被自注意力显式编码。一项由Yuchuan Tian等10位研究者提交至arXiv的新工作(论文编号2607.18413,提交于2026年7月20日)系统研究了能否通过轻量级深度可分离卷积为LLM提供这种局部归纳偏置,同时不显著增加模型尺寸。
研究团队以Qwen3 Transformer块为测试平台,进行了宏观层面的消融实验。他们在块内部的17个不同位置插入卷积操作,对比各个位置对下游任务的影响。实验结果表明,将卷积应用于投影后的查询、键和值(QKV)且位于注意力计算之前,能够取得最佳效果。在此基础上,团队进一步进行了微观层面的设计空间探索,最终确定的优化方案是一个残差深度可分离卷积,其核大小为3,且不附加额外的归一化层或激活函数。
为了验证该设计的通用性,研究者将其整合到不同规模的Qwen3模型中,并采用多种预训练数据预算进行训练。在七个涵盖常识推理、文本分类等能力的下游基准测试上,该设计平均准确率均获得提升,而引入的额外参数仅占模型总参数的不到0.01%。此外,一项针对表示层的案例分析显示,卷积使得重复出现的token ID对其直接上下文更加敏感,这直观地说明了卷积增强了局部信息建模能力。
该研究为改进LLM的结构提供了一种简洁而有效的思路:深度可分离卷积可以作为自注意力的轻量级补充,专门用于建模短距离token交互。这一发现有望在保持模型效率的同时,提升LLM在需要精细局部理解的任务上的表现。