Minerva-Ego:用于自我中心视频理解的时空提示
Minerva-Ego是一个新的基准测试,用于评估复杂自我中心视觉推理,包含多步骤多模态问题和密集标注的推理轨迹。实验表明,当前最先进的模型与人类性能仍有较大差距,而加入“何时何地”的提示可显著提升性能。
自我中心视频理解是具身智能体的核心能力之一,它要求模型从第一人称视角的视频中理解场景、对象和事件,并基于此进行推理和决策。然而,现有的基准测试大多只评估模型的最终输出(例如问题的答案),而忽略了中间推理过程的评估。此外,大多数基准测试只涉及文本领域的答案,未能充分利用视觉-语言多模态信息。为了弥补这一空白,来自Google DeepMind等机构的研究人员提出了Minerva-Ego基准测试,旨在系统评估模型在自我中心视频上的复杂视觉推理能力。
Minerva-Ego基于高质量的自我中心/具身视频数据源,扩展了一系列具有挑战性的多步骤多模态问题。每个问题都附带了人类标注的密集时空推理轨迹,这些轨迹不仅记录了最终答案,还详细描述了每一步推理所需关注的对象及其时空位置。这样的设计使得研究人员能够深入分析模型的推理过程,而不仅仅是比较最终答案。
在基准测试中,研究人员对当前最先进的视觉语言模型进行了评估,发现它们与人类表现之间仍存在显著差距,尤其是在中间推理步骤上。为了深入探究这一差距,研究人员对每条推理轨迹进行了对象级时空掩码标注,明确了回答问题所需的关键物体。通过大量实验,他们发现向模型提供“何时何地”查看的提示(即提示模型关注特定的时空区域)可以显著提升模型性能,这表明模型在利用时空线索方面还有很大的提升空间。
Minerva-Ego数据集已在GitHub上开源(https://github.com/google-deepmind/neptune),供研究人员下载使用。这一工作不仅为自我中心视频推理提供了更全面的评估手段,也为未来的模型改进指明了方向:通过引入时空提示,可以引导模型更有效地进行多步骤推理,从而缩小与人类智能的差距。