LoKiFormer:面向高效大语言模型预训练的局部感知注意力与解耦知识记忆架构
一篇被ICML 2026接收的论文提出LoKiFormer架构,通过局部融合注意力和知识记忆模块,分别增强序列内部局部建模和外部全局知识访问,预训练收敛速度比基线快1.33倍。
大型语言模型(LLM)在各类任务中表现卓越,但其预训练架构在效率上仍有明显短板。一篇近日出现在 arXiv 上的论文(编号 2608.12419,已被 ICML 2026 接收)指出,当前主流架构存在两个核心问题:第一,自注意力机制缺少对局部性的显式归纳偏置,模型会重复建模序列内部的局部信息;第二,混合专家模型(MoE)将知识存储与计算路径隐式绑定,导致模型难以灵活调用序列之外、训练语料中的全局知识。作者认为,这两点共同造成了预训练阶段的冗余计算与知识利用不充分。
针对上述问题,由 Qiuwu Chen 领衔的 11 位研究者提出了名为 LoKiFormer 的新架构。该架构在标准解码器之外额外引入两个专用模块。其一是局部融合注意力(Local Fusion Attention, LFA),它在注意力计算前加入卷积融合操作,使模型能够显式捕捉相邻 token 之间的局部模式,再让注意力机制基于更富信息量的表示进行交互,从而减少对局部信息的重复建模。其二是知识记忆模块(Knowledge Memory Module, KMM),该模块利用参数化的键值记忆,将全局知识显式存放在可寻址的槽位中,使存储与计算相互解耦。这样一来,模型在预训练时既可以利用局部上下文,也可以直接检索外部全局知识,无需像 MoE 那样把知识压缩进神经网络的权重里。
实验部分,LoKiFormer 与多种基线模型进行了对比,其中包括标准的 Transformer 架构和基于 MoE 的模型。结果显示,该架构在预训练阶段的收敛速度达到基线的 1.33 倍。这意味着在相同计算预算下,LoKiFormer 可以更快地达到目标困惑度,或者在相同训练步数内获得更低的损失。论文作者认为,这一提升来自对局部与全局信息的更高效整合,同时也说明解耦存储与计算可能成为未来高效 LLM 设计的重要方向。此外,LFA 与 KMM 的互补设计使得模型既保留了注意力的全局建模能力,又具备局部的归纳偏置和显式的知识访问路径。
该论文于 2026 年 8 月 12 日提交至 arXiv,并已获得 ICML 2026 录用。论文所属领域为机器学习(cs.LG),并已分配 arXiv 编号 2608.12419,同时提供了 PDF 与 HTML 版本供研究者阅读。值得注意的是,论文的 DOI 正在通过 DataCite 注册,尚未生效。对于关注 LLM 预训练效率、注意力机制改进以及知识存储设计的研究者,LoKiFormer 提供了一个值得深入分析的新思路。