Fre-Res:面向高效视频多模态大模型的频率残差视频令牌压缩
Fre-Res是一种预算自适应的双轨视频令牌压缩框架,通过分离稀疏高保真空间锚点与紧凑频率残差令牌,在保持高保真空间细节的同时高效编码时序动态,在多个视频推理基准上实现了精度与效率的平衡。
来源arXiv Computer Vision作者: Yigui Feng (The College of Computer Science, National University of Defense Technology, Changsha, Hunan, China), Qinglin Wang (The College of Computer Science, National University of Defense Technology, Changsha, Hunan, China), Yang Liu (The Shien-Ming Wu School of Intelligent Engineering, South China University of Technology, Guangzhou, Guangdong, China), Jie Liu (The College of Computer Science, National University of Defense Technology, Changsha, Hunan, China)
视频多模态大模型(Video MLLMs)长期以来面临空间保真度与时间覆盖范围之间的权衡:保留精细视觉细节需要大量空间令牌,而捕捉短暂事件则需要密集的时间采样。为解决这一矛盾,研究者提出了Fre-Res(Frequency-Residual Video Token Compression),一种预算自适应的双轨视频令牌压缩框架。该框架将两种证据分离处理:一方面保留稀疏的高保真空间锚点,另一方面通过紧凑的频率残差令牌来表征密集的时序演化。
具体而言,Fre-Res在视觉潜在空间中对帧间残差轨迹应用时间一维离散余弦变换(1D-DCT),并观察到强烈的低频集中现象。为了将频域动态与原生视觉嵌入对齐,Fre-Res引入了空间引导吸收器(Spatial-Guided Absorber),该模块将时序残差信息注入空间对应的锚点令牌中。这种设计使得模型能够同时保持空间细节和捕捉时间变化,而无需增加过多的视觉令牌。
在细粒度短和长视频推理基准上的实验表明,Fre-Res实现了良好的精度-效率折中。它能够匹配或接近全令牌性能,同时大幅缩短视觉令牌长度。广泛消融实验进一步揭示,时序频率残差保留了因果转换线索,而空间锚点对于细粒度物体和布局推理仍不可或缺。这一工作为高效视频理解提供了新的思路,有望推动视频多模态模型在实际应用中的部署。