AI News HubLIVE
站内改写1 分钟阅读

CRAFT: 基于评论者精炼的自适应关键帧定位的多模态视频问答

CRAFT是一种用于真实世界新闻事件的多视频问答的查询条件化管道。它结合了动态关键帧选择、每视频自动语音识别(带多语言回退)以及混合评论者循环,以迭代验证和修复声明。在MAGMaR 2026基准测试中,CRAFT取得了最佳总体平均值(0.739)、参考召回率(0.810)和引用F1(0.635)。在WikiVideo的转换版本上同样表现强劲(平均0.823),展示了其泛化能力。消融实验显示,原子声明、ASR和评论者循环是主要性能提升来源。

来源arXiv Computer Vision作者: Mahesh Bhosale, Abdul Wasi, Vishvesh Trivedi, Pengyu Yan, Akhil Gorugantu, David Doermann

CRAFT(Critic-Refined Adaptive Key-Frame Targeting)是一项由Mahesh Bhosale等人于2026年5月18日提交至arXiv的研究成果,并被ACL 2026的多模态增强生成研讨会接收。该系统针对真实世界新闻事件的多视频问答任务,要求从异构视频档案中检索与查询相关的证据,并为每个声明标注来源。CRAFT采用查询条件化管道,首先通过动态关键帧选择从每个视频中提取最相关的帧,然后对每帧进行自动语音识别(ASR),并支持多语言回退以处理非英语内容。接下来,一个混合评论者循环被用来迭代验证和修复声明,该循环整合了UNLI时间蕴含模型、DeBERTa-v3跨声明筛选器和Llama-3.2-3B裁决器。最后,通过引用合并阶段将每个事实与其所有支持来源标识符一起输出,确保每个声明都有多个视频来源的支撑。在MAGMaR 2026基准测试中,CRAFT取得了最佳总体平均分0.739,参考召回率0.810,引用F1得分0.635,显著优于现有方法。为了测试泛化能力,研究者还将WikiVideo数据集转换为MAGMaR格式,并在52个不重叠的事件查询上评估,CRAFT获得了平均0.823的高分,证明其以声明为中心的证据聚合方法具有普适性。消融实验表明,原子声明分解、ASR使用和评论者循环是相对于基线的主要性能增益来源。这些组件共同提升了系统在复杂多视频场景下的检索和归因能力。相关代码和实现细节已在GitHub上公开,供社区复现和改进。