AI News HubLIVE
站内改写2 分钟阅读

CausalGate:基于因果重要性蒸馏的Transformer模块剪枝

现有的大语言模型自适应推理方法通常依赖隐藏状态相似性或激活幅度等启发式规则来丢弃冗余模块,但这些基于相关性的指标难以捕捉对语义准确性至关重要的非线性结构计算。CausalGate提出了一种干预引导框架,通过隔离子层并衡量输出归零对最终logit分布的KL散度影响,建立结构重要性层级,再将其蒸馏为静态轻量级标量门,实现零运行时开销的高效推理。在多个模型和基准上的实验表明,CausalGate显著优于现有动态路由方法。

来源arXiv Machine Learning作者: Kiran Nair, Smriti Regmi, Rodrigue Rizk

近年来,大语言模型(LLM)的规模持续增长,推动了自适应推理方法的发展,这些方法旨在通过动态跳过冗余模块来降低计算成本。然而,现有方法大多依赖隐藏状态相似性或激活幅度等观测性启发式规则,这些基于相关性的指标往往无法捕捉到对语义准确性至关重要的非线性结构计算。针对这一局限,研究团队提出了CausalGate,一种基于因果干预的框架。

在校准阶段,CausalGate逐一隔离Transformer中的Attention和MLP子层,将其输出置零,并通过最终logit分布的Kullback-Leibler散度精确量化对语义的损害。具体来说,对于每个子层,CausalGate将其输出置为零,然后计算修改后模型在验证样本上的最终logit分布与原始分布之间的KL散度。该散度值越大,说明该子层对语义输出越重要。通过遍历所有子层,得到重要性得分向量。这一过程建立了每个子层的结构性重要性层级。

为了消除运行时路由开销,CausalGate采用指数移动平均(EMA)平滑目标结合可微分的成对排序损失,将重要性层级蒸馏为一组全局静态的轻量级标量门。EMA用于平滑训练过程中的重要性估计,排序损失确保门控值反映子层之间的相对重要性顺序。最终学习到的门控是标量值,位于0到1之间,推理时通过阈值决定是否跳过该子层。这样,推理时无需任何动态决策,即可根据预先学习的门值选择保留或跳过模块。

实验在TinyLlama-1.1B、Qwen2.5-3B和Llama-3.1-8B上进行,涵盖语言建模和常识推理基准。在TinyLlama-1.1B上,CausalGate在保持98%以上原始性能的同时,减少了50%的FLOPs;在Qwen2.5-3B和Llama-3.1-8B上,也展现出类似的效率提升。与SkipLayer、ActivationParing等基线相比,CausalGate在计算节省和硬件延迟降低方面一致优于主流动态路由和层跳过方法,且不增加运行时开销。由于门控是静态的,实际硬件延迟直接对应于计算减少,而不需要额外的路由决策开销。

该工作已被会议接收,提供了高效Transformer推理的新思路。论文由Kiran Nair等人提交,于2026年7月21日发布在arXiv上,目前正在会议审稿中。这项研究的价值在于,它从因果角度重新定义了模块重要性,避免了相关性的谬误。未来,CausalGate可以扩展到其他架构和任务中,为高效推理提供通用框架。