MARCH:通过内容路由状态锚点扩展循环记忆
MARCH通过周期性地缓存循环状态检查点作为“状态锚点”,为固定大小的循环记忆引入可增长的内容寻址记忆库。该方法保留了高效的循环计算路径,同时能够随上下文长度扩展记忆容量,并在标准预训练后于常识推理、LongBench和上下文检索上超越多种线性注意力变体。
在长上下文建模中,Transformer 与循环模型分别代表了两种不同的取舍。Transformer 的优势在于它保留了 token 级别的记忆,这种记忆随上下文长度线性增长,因此能够精细地回溯较早的信息,从而在长文本检索和知识召回任务中表现突出。但这份能力并非没有代价:训练时的注意力计算量随序列长度呈二次方增长,推理阶段还需要维护同样不断膨胀的键值缓存,导致显存占用和延迟随之上升。
循环类架构(如状态空间模型)则走另一条路线:它们把全部历史信息压缩进一个固定大小的隐状态,解码时只需要更新这个状态,计算成本与序列长度基本解耦,因此推理效率很高。然而,固定大小意味着容量有限,早期的关联信息很容易被后续输入覆盖,模型往往只能记住最近的内容,在需要精确回忆的基准上明显弱于 Transformer。
针对这一矛盾,Ming Zhang 等九位研究者提出了 MARCH(Memory-Anchor Routing across Context History)。其核心思想是给循环模型增加一个可扩展的“外部记忆库”:模型每隔一定步数就把当前的循环状态检查点保存下来,称为状态锚点;每个锚点会附带一个由内容决定的紧凑键。这样,随着上下文变长,记忆库中的锚点数量也会增加,历史信息的解析度与内存开销之间可以按需调节。
在具体计算时,MARCH 让每个 token 生成一个锚点查询,去检索所有因果上可用的历史锚点,并把检索结果以类似注意力的方式与当前状态聚合。换言之,模型既保留了原有的循环计算主干,又获得了一条额外的长期记忆通路,不需要像 Transformer 那样维护完整的键值缓存,也不会被固定大小的状态所限制。
论文在标准预训练设置下进行了评估,实验涵盖常识推理、LongBench 长上下文基准以及上下文检索任务。结果显示,MARCH 在多个线性注意力变体之上取得了一致的性能优势,说明内容路由的状态缓存确实能强化循环模型的长期记忆,同时保住其高效的原生计算路径。此外,锚点间隔的选择会直接影响记忆的粒度:间隔越小,历史细节越丰富,但存储和检索开销也会随之增加;间隔越大,记忆越粗糙,但效率更高。
该论文 2026 年 8 月 12 日提交至 arXiv,编号 2608.12435,目前在 cs.LG 分类下,DOI 为 10.48550/arXiv.2608.12435。论文由 Ming Zhang 等九位作者完成,arXiv 的记录显示稿件提交人为 Youbang Sun。需要指出的是,实验结论基于标准预训练配置,实际部署中的收益仍取决于具体任务与算力约束。