AI News HubLIVE
站內改寫1 分鐘閱讀

Fre-Res:面向高效影片多模態大模型的頻率殘差影片令牌壓縮

Fre-Res是一種預算自適應的雙軌影片令牌壓縮框架,透過分離稀疏高保真空間錨點與緊湊頻率殘差令牌,在保持高保真空間細節的同時高效編碼時序動態,在多個影片推理基準上實現了精度與效率的平衡。

來源arXiv Computer Vision作者: Yigui Feng (The College of Computer Science, National University of Defense Technology, Changsha, Hunan, China), Qinglin Wang (The College of Computer Science, National University of Defense Technology, Changsha, Hunan, China), Yang Liu (The Shien-Ming Wu School of Intelligent Engineering, South China University of Technology, Guangzhou, Guangdong, China), Jie Liu (The College of Computer Science, National University of Defense Technology, Changsha, Hunan, China)

影片多模態大模型(Video MLLMs)長期以來面臨空間保真度與時間覆蓋範圍之間的權衡:保留精細視覺細節需要大量空間令牌,而捕捉短暫事件則需要密集的時間取樣。為解決這一矛盾,研究者提出了Fre-Res(Frequency-Residual Video Token Compression),一種預算自適應的雙軌影片令牌壓縮框架。該框架將兩種證據分離處理:一方面保留稀疏的高保真空間錨點,另一方面透過緊湊的頻率殘差令牌來表徵密集的時序演化。

具體而言,Fre-Res在視覺潛在空間中對幀間殘差軌跡應用時間一維離散餘弦變換(1D-DCT),並觀察到強烈的低頻集中現象。為了將頻域動態與原生視覺嵌入對齊,Fre-Res引入了空間引導吸收器(Spatial-Guided Absorber),該模組將時序殘差資訊注入空間對應的錨點令牌中。這種設計使得模型能夠同時保持空間細節和捕捉時間變化,而無需增加過多的視覺令牌。

在細粒度短和長影片推理基準上的實驗表明,Fre-Res實現了良好的精度-效率折中。它能夠匹配或接近全令牌效能,同時大幅縮短視覺令牌長度。廣泛消融實驗進一步揭示,時序頻率殘差保留了因果轉換線索,而空間錨點對於細粒度物體和佈局推理仍不可或缺。這一工作為高效影片理解提供了新的思路,有望推動影片多模態模型在實際應用中的部署。