視覺 token 剪枝是降低視覺語言模型(VLM)推理成本的重要手段。常規剪枝方法通常只解決一個問題:應該保留哪些 token。這種以“保留”為中心的思路有一個隱患:它可能留下大量得分高但彼此冗餘的 token,而當某些被丟棄的區域缺乏足夠接近的保留代表時,模型的視覺證據就會產生缺口。CoverPruner 正是針對這一盲點提出的一種無需訓練的剪枝方法。它的核心視角是“需求側”:一旦一個 token 被移除,目標 VLM 中應由哪個倖存的原始 token 來承擔它的表達職責?
具體而言,CoverPruner 將剪枝形式化為表示覆蓋最大化(Representational Coverage Maximization, RCM)問題。模型對視覺證據的需求以查詢權重形式進入優化目標,剪枝結果需要讓保留下來的 token 集合覆蓋投影后的完整視覺 token 集合。為了實現這一目標,CoverPruner 在視覺-語言投影器(projector)的表示空間中計算覆蓋程度,並藉助一個輕量級的第一層注意力探針來估計 token 之間的關係。整個過程不需要額外的訓練,因此可以直接應用到不同的 VLM 架構上。
這種設計帶來兩個直接收益。其一是把剪枝從“挑選高分 token”轉變為“覆蓋證據需求”,避免高冗餘得分 token 擠佔有限的預算。其二是訓練無關特性顯著提升了方法的通用性,使其能夠在多種視覺語言模型上快速部署。
論文在多個主流 VLM 架構和不同壓縮率上進行了對比實驗。結果顯示,CoverPruner 在所有參與比較的方法中取得了最佳平均準確率,而且最大提升通常出現在壓縮最激進的設定中。這説明,當可用 token 預算非常緊張時,僅靠重要性評分決定去留遠遠不夠;讓每個被剪除的 token 都有一個“代言者”,對保持模型對視覺內容的覆蓋能力至關重要。
該論文題為《誰為被剪除的視覺Token代言?——將視覺Token剪枝建模為覆蓋優化》,由 Qingchan Zhu 與其他五位作者共同完成,2026年9月2日提交至 arXiv,編號 arXiv:2609.03158,並被 EMNLP 2026 主會接收。論文同時涉及計算機視覺與模式識別(cs.CV)、計算與語言(cs.CL)和機器學習(cs.LG)方向。該項研究為高效 VLM 推理提供了一個新的思路。