跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

谁为被剪除的视觉Token代言?——将视觉Token剪枝建模为覆盖优化

文章摘要

CoverPruner 是一种面向视觉语言模型的免训练视觉 token 剪枝方法。它不只问“保留哪些 token”,而是进一步问“每个被移除的 token 该由哪个幸存 token 代表”,并将剪枝建模为表示覆盖最大化。借助投影器空间覆盖和轻量第一层注意力探针,CoverPruner 在多种 VLM 架构与压缩率下取得最佳平均准确率,且在激进压缩下增益最大。

来源arXiv Computer Vision作者: Qingchan Zhu, Weihang You, Hanqi Jiang, Changdi Yang, Tianming Liu, Geng Yuan
谁为被剪除的视觉Token代言?——将视觉Token剪枝建模为覆盖优化
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

视觉 token 剪枝是降低视觉语言模型(VLM)推理成本的重要手段。常规剪枝方法通常只解决一个问题:应该保留哪些 token。这种以“保留”为中心的思路有一个隐患:它可能留下大量得分高但彼此冗余的 token,而当某些被丢弃的区域缺乏足够接近的保留代表时,模型的视觉证据就会产生缺口。CoverPruner 正是针对这一盲点提出的一种无需训练的剪枝方法。它的核心视角是“需求侧”:一旦一个 token 被移除,目标 VLM 中应由哪个幸存的原始 token 来承担它的表达职责?

具体而言,CoverPruner 将剪枝形式化为表示覆盖最大化(Representational Coverage Maximization, RCM)问题。模型对视觉证据的需求以查询权重形式进入优化目标,剪枝结果需要让保留下来的 token 集合覆盖投影后的完整视觉 token 集合。为了实现这一目标,CoverPruner 在视觉-语言投影器(projector)的表示空间中计算覆盖程度,并借助一个轻量级的第一层注意力探针来估计 token 之间的关系。整个过程不需要额外的训练,因此可以直接应用到不同的 VLM 架构上。

这种设计带来两个直接收益。其一是把剪枝从“挑选高分 token”转变为“覆盖证据需求”,避免高冗余得分 token 挤占有限的预算。其二是训练无关特性显著提升了方法的通用性,使其能够在多种视觉语言模型上快速部署。

论文在多个主流 VLM 架构和不同压缩率上进行了对比实验。结果显示,CoverPruner 在所有参与比较的方法中取得了最佳平均准确率,而且最大提升通常出现在压缩最激进的设定中。这说明,当可用 token 预算非常紧张时,仅靠重要性评分决定去留远远不够;让每个被剪除的 token 都有一个“代言者”,对保持模型对视觉内容的覆盖能力至关重要。

该论文题为《谁为被剪除的视觉Token代言?——将视觉Token剪枝建模为覆盖优化》,由 Qingchan Zhu 与其他五位作者共同完成,2026年9月2日提交至 arXiv,编号 arXiv:2609.03158,并被 EMNLP 2026 主会接收。论文同时涉及计算机视觉与模式识别(cs.CV)、计算与语言(cs.CL)和机器学习(cs.LG)方向。该项研究为高效 VLM 推理提供了一个新的思路。

展开要点与分析

文章情报

工程师进阶

要点

  • 提出需求侧视角:为每个被剪除的 token 找到能代表它的幸存 token。
  • 将剪枝形式化为查询加权的表示覆盖最大化(RCM)。
  • 采用投影器空间覆盖与轻量第一层注意力探针,无需训练。
  • 在多种 VLM 架构下平均准确率最优,激进压缩时提升最明显。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。