AI News HubLIVE
站内改写1 分钟阅读

ChronoStitch:无需训练的视觉KV记忆组合方法实现长时域推理

本文提出ChronoStitch,一种无需训练的方法,用于组合独立存储的视觉键值(KV)记忆,以解决长视频问答中的时域推理问题。该方法通过将存储的旋转后键重新映射到全局多模态RoPE坐标系,并选择性重计算部分高偏差视觉令牌,克服了朴素拼接导致的时间相位冲突和内容缺失。实验表明,在Qwen2.5-VL-3B和TempCompass时域分割上,ChronoStitch在事件顺序准确性上优于朴素组合和仅位置变体,且速度比完整联合预填充快3.3倍。

来源arXiv Computer Vision作者: Santiram Tiwari, Nishant Sinha, Kunal Kislay

长视频问答(Long-video QA)是计算机视觉领域的重要挑战,要求模型能够在不重复处理相同视频的情况下,随时间保留视觉证据并回答关于事件顺序、频率和变化的问题。一个实用的解决方案是存储视觉语言模型(VLM)内部每个视频块的键值(KV)缓存,并在查询时检索这些状态。然而,独立缓存的视频块无法正确组合:每个块都是从局部旋转位置零开始预填充的,因此朴素拼接会导致时间相位冲突,并丢失全局顺序,从而无法回答关于“什么先发生”、“事件发生频率”或“视频中哪些部分发生了变化”等问题。

为了克服这一局限,Santiram Tiwari等人在其论文中提出了ChronoStitch,一种无需额外训练的视觉KV记忆组合方法。该方法首先将存储的后旋转键重新基于一个全局三轴多模态RoPE(Rotary Position Embedding)坐标系,该坐标系能够保留时间、高度和宽度结构。作者证明,简单的一维标量重新索引对于视觉令牌在几何上是不一致的,因为它会将帧内的空间顺序转化为虚假的时间位移。为了解决位置修复后残留的内容差距——即后续块在最初编码时没有关注前面的块——ChronoStitch选择性地重新计算后续块中一小部分高偏差的视觉令牌,同时允许它们关注组合后的缓存。

实验部分,研究团队在Qwen2.5-VL-3B模型和TempCompass基准的时域分割上进行了评估。结果显示,ChronoStitch在事件排序准确性上显著优于朴素组合和仅位置变体,同时运行速度比完整联合预填充快3.3倍。这一结果为长视频理解提供了一种高效、无需额外训练的解决方案,有望推动视频问答、视频摘要和视频监控等应用的发展。