跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

誰為被剪除的視覺Token代言?——將視覺Token剪枝建模為覆蓋優化

文章摘要

CoverPruner 是一種面向視覺語言模型的免訓練視覺 token 剪枝方法。它不只問“保留哪些 token”,而是進一步問“每個被移除的 token 該由哪個倖存 token 代表”,並將剪枝建模為表示覆蓋最大化。藉助投影器空間覆蓋和輕量第一層注意力探針,CoverPruner 在多種 VLM 架構與壓縮率下取得最佳平均準確率,且在激進壓縮下增益最大。

來源arXiv Computer Vision作者: Qingchan Zhu, Weihang You, Hanqi Jiang, Changdi Yang, Tianming Liu, Geng Yuan
誰為被剪除的視覺Token代言?——將視覺Token剪枝建模為覆蓋優化
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

視覺 token 剪枝是降低視覺語言模型(VLM)推理成本的重要手段。常規剪枝方法通常只解決一個問題:應該保留哪些 token。這種以“保留”為中心的思路有一個隱患:它可能留下大量得分高但彼此冗餘的 token,而當某些被丟棄的區域缺乏足夠接近的保留代表時,模型的視覺證據就會產生缺口。CoverPruner 正是針對這一盲點提出的一種無需訓練的剪枝方法。它的核心視角是“需求側”:一旦一個 token 被移除,目標 VLM 中應由哪個倖存的原始 token 來承擔它的表達職責?

具體而言,CoverPruner 將剪枝形式化為表示覆蓋最大化(Representational Coverage Maximization, RCM)問題。模型對視覺證據的需求以查詢權重形式進入優化目標,剪枝結果需要讓保留下來的 token 集合覆蓋投影后的完整視覺 token 集合。為了實現這一目標,CoverPruner 在視覺-語言投影器(projector)的表示空間中計算覆蓋程度,並藉助一個輕量級的第一層注意力探針來估計 token 之間的關係。整個過程不需要額外的訓練,因此可以直接應用到不同的 VLM 架構上。

這種設計帶來兩個直接收益。其一是把剪枝從“挑選高分 token”轉變為“覆蓋證據需求”,避免高冗餘得分 token 擠佔有限的預算。其二是訓練無關特性顯著提升了方法的通用性,使其能夠在多種視覺語言模型上快速部署。

論文在多個主流 VLM 架構和不同壓縮率上進行了對比實驗。結果顯示,CoverPruner 在所有參與比較的方法中取得了最佳平均準確率,而且最大提升通常出現在壓縮最激進的設定中。這説明,當可用 token 預算非常緊張時,僅靠重要性評分決定去留遠遠不夠;讓每個被剪除的 token 都有一個“代言者”,對保持模型對視覺內容的覆蓋能力至關重要。

該論文題為《誰為被剪除的視覺Token代言?——將視覺Token剪枝建模為覆蓋優化》,由 Qingchan Zhu 與其他五位作者共同完成,2026年9月2日提交至 arXiv,編號 arXiv:2609.03158,並被 EMNLP 2026 主會接收。論文同時涉及計算機視覺與模式識別(cs.CV)、計算與語言(cs.CL)和機器學習(cs.LG)方向。該項研究為高效 VLM 推理提供了一個新的思路。

展開要點與分析

文章情報

工程師進階

要點

  • 提出需求側視角:為每個被剪除的 token 找到能代表它的倖存 token。
  • 將剪枝形式化為查詢加權的表示覆蓋最大化(RCM)。
  • 採用投影器空間覆蓋與輕量第一層注意力探針,無需訓練。
  • 在多種 VLM 架構下平均準確率最優,激進壓縮時提升最明顯。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。