LVSum:时间戳感知的长视频摘要基准
LVSum是一个人工标注的基准,用于评估多模态大模型在长视频摘要中的时间对齐能力。包含72个视频,平均时长16分钟,每个视频有最多10个人工生成的含时间参考的摘要。研究发现,转录文本比视觉帧贡献更大,模型与人工摘要差距显著,且MLLMs在时间定位、指令遵循和跨模态一致性方面存在系统性弱点。
多模态大语言模型(MLLMs)在长视频摘要任务中面临重大挑战,尤其是在保持长时间跨度的时间忠实度以及生成既在语义上又在时间上有根据的摘要方面。为此,Apple Machine Learning Research团队推出了LVSum——一个用于评估长视频摘要且具有细粒度时间对齐能力的人工标注基准。该基准包含72个来自13个领域(如体育、新闻、纪录片等)的多样化视频,平均时长为16分钟,每个视频配有最多10个包含时间参考的人工摘要,总计超过700个人工摘要。这些摘要不仅描述了视频内容,还精确标注了事件发生的时间戳,从而能够评估模型对时间信息的利用能力。
团队利用新提出的基于LLM的指标(涵盖内容相关性和模态一致性)以及标准自动指标(如ROUGE、METEOR),对领先的专有和开源MLLMs(包括GPT-4V、Gemini、LLaVA等)进行了全面评估。实验揭示三个关键发现:首先,转录文本对摘要质量的贡献远大于仅依赖视觉帧,这说明当前的MLLMs更擅长处理文本信息而非视觉时间序列;其次,模型生成的摘要与人工撰写的摘要之间仍存在显著的性能差距,最高端的模型也远未达到人类水平;最后,当前MLLMs在时间定位、指令遵循以及跨模态一致性方面表现出系统性弱点,例如无法准确识别事件顺序、忽略时间约束,以及视觉与语言信息整合不佳。
该研究强调了改进MLLMs时间理解能力的必要性,并为未来长视频摘要研究提供了标准化评估工具。代码和数据集已在GitHub上开源,可供研究人员使用。此外,论文还指出,当前许多模型依赖于帧级别的空间信息,而忽略了时间动态,这限制了它们在视频理解任务中的表现。LVSum的发布有望推动该领域的发展,促使研究者开发更具时间感知能力的多模态模型。