视觉 token 剪枝是降低视觉语言模型(VLM)推理成本的重要手段。常规剪枝方法通常只解决一个问题:应该保留哪些 token。这种以“保留”为中心的思路有一个隐患:它可能留下大量得分高但彼此冗余的 token,而当某些被丢弃的区域缺乏足够接近的保留代表时,模型的视觉证据就会产生缺口。CoverPruner 正是针对这一盲点提出的一种无需训练的剪枝方法。它的核心视角是“需求侧”:一旦一个 token 被移除,目标 VLM 中应由哪个幸存的原始 token 来承担它的表达职责?
具体而言,CoverPruner 将剪枝形式化为表示覆盖最大化(Representational Coverage Maximization, RCM)问题。模型对视觉证据的需求以查询权重形式进入优化目标,剪枝结果需要让保留下来的 token 集合覆盖投影后的完整视觉 token 集合。为了实现这一目标,CoverPruner 在视觉-语言投影器(projector)的表示空间中计算覆盖程度,并借助一个轻量级的第一层注意力探针来估计 token 之间的关系。整个过程不需要额外的训练,因此可以直接应用到不同的 VLM 架构上。
这种设计带来两个直接收益。其一是把剪枝从“挑选高分 token”转变为“覆盖证据需求”,避免高冗余得分 token 挤占有限的预算。其二是训练无关特性显著提升了方法的通用性,使其能够在多种视觉语言模型上快速部署。
论文在多个主流 VLM 架构和不同压缩率上进行了对比实验。结果显示,CoverPruner 在所有参与比较的方法中取得了最佳平均准确率,而且最大提升通常出现在压缩最激进的设定中。这说明,当可用 token 预算非常紧张时,仅靠重要性评分决定去留远远不够;让每个被剪除的 token 都有一个“代言者”,对保持模型对视觉内容的覆盖能力至关重要。
该论文题为《谁为被剪除的视觉Token代言?——将视觉Token剪枝建模为覆盖优化》,由 Qingchan Zhu 与其他五位作者共同完成,2026年9月2日提交至 arXiv,编号 arXiv:2609.03158,并被 EMNLP 2026 主会接收。论文同时涉及计算机视觉与模式识别(cs.CV)、计算与语言(cs.CL)和机器学习(cs.LG)方向。该项研究为高效 VLM 推理提供了一个新的思路。