AI News HubLIVE
站内改写2 分钟阅读

VideoSEAL:通过解耦答案权威缓解智能体长视频理解中的证据不匹配

本文提出VideoSEAL框架,通过解耦规划与答案权威,解决长视频理解中智能体产生正确答案但缺乏证据支持的问题,在多个基准测试上取得领先性能。

来源arXiv Computer Vision作者: Chenhao Qiu (Mango TV), Yechao Zhang (Nanyang Technological University), Xin Luo (Mango TV), Shien Song (Mango TV), Xusheng Liu (Mango TV)

长视频问答是一项极具挑战性的任务,要求模型从高度冗余的视频内容中定位稀疏且时间分散的视觉证据。尽管当前的多模态大语言模型(MLLMs)在短视频上表现出色,但长视频的长度和复杂性迫使模型进行多轮、智能体式的交互搜索与验证。然而,现有长视频理解智能体常常出现一种被称为“证据不匹配”的现象:它们能够给出正确答案,但该答案实际上并未得到其检索或检查的证据的支持。

为了刻画这一失败模式,研究人员引入了两种诊断指标:时间接地性和语义接地性。时间接地性衡量证据的时间定位是否准确,而语义接地性评估证据的内容是否与答案匹配。利用这些指标,他们揭示了放大不匹配的两种压力:推理时的提示压力(由于共享上下文饱和)和训练时的奖励压力(由于仅关注结果的优化)。这些发现指向了一个结构性的根本原因:耦合的智能体范式将长期规划与答案权威混为一谈,导致规划决策直接影响答案生成,而忽视了证据验证。

为此,本文提出了解耦的规划器-检查器框架(VideoSEAL)。该框架将规划与答案权威彻底分离:规划器负责制定搜索策略,而检查器负责像素级验证,并基于验证结果门控最终答案。在四个长视频基准测试上,VideoSEAL显著提高了答案准确性和证据对齐程度,在LVBench上达到55.1%,在LongVideoBench上达到62.0%,同时生成可解释的搜索轨迹。此外,解耦架构随着搜索预算的增加表现出一致的扩展性,并支持在不重新训练规划器的情况下即插即用地升级MLLM骨干网络。代码和模型已在GitHub开源。该论文已被ICML 2026接收,全文共计33页,包含13张图表。研究团队来自多家机构,由陈浩秋(音译)领衔。

这一工作为长视频理解智能体的可信性提供了新思路,不仅提升了答案的准确性,更重要的是确保了答案有可靠的证据支撑,这对于高风险应用如医疗视频分析和自动驾驶场景中的视频理解尤为关键。未来的工作可以进一步优化检查器的效率,并探索在更多模态上的泛化能力。