AI News HubLIVE
站内改写2 分钟阅读

PerceptionBench:评估多模态大语言模型的原子视觉感知能力

PerceptionBench 是一个全新基准测试,专注于隔离和评估多模态大语言模型的原子视觉感知能力。该基准从 42 个现有基准中的模型失败模式中归纳出 10 种原子感知能力,并构建了 3000 个经人工验证的问题。测试显示,顶尖模型均未达到 60% 的准确率,且感知相关的幻觉是平均最弱的能力。PerceptionBench 旨在精确诊断视觉感知的薄弱环节,推动多模态 AI 实现可靠且一致的视觉理解。

来源Kimi Blog

Kimi 团队近日发布了 PerceptionBench,这是一个旨在精准评估多模态大语言模型(MLLMs)原子视觉感知能力的新基准。与以往侧重整体性能的基准不同,PerceptionBench 致力于将视觉感知分解为一系列基础能力,并逐一进行严格测试。

该基准的独特之处在于其分类体系并非预先定义,而是从模型的实际失败中归纳而来。研究团队分析了 42 个现有基准中前沿模型的所有错误,追溯至最早的失误步骤,最终总结出 10 种原子感知能力:视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉。基于这一分类,团队构建了一个包含 3000 个经人工验证问题的测试集,其中 60% 的问题源自对模型失败案例的分解,40% 为全新编写。每个问题都严格设计为仅依赖视觉感知即可作答,无需任何推理或外部知识。

PerceptionBench 的评估结果令人深思。在 16 个前沿多模态大语言模型中,没有任何模型达到 60% 的准确率。平均而言,与感知相关的幻觉是最弱的能力。值得注意的是,整体得分几乎相同的模型,其实际感知能力可能存在显著差异。这表明,仅依赖综合得分无法全面反映模型在视觉感知方面的真实缺陷。

基准中包含了多种类型的问题示例。例如,在视觉定位任务中,模型需要根据钟表上 Gemini 符号的位置回答具体时刻;在深度与 3D 任务中,模型需判断场景中物体前后的远近关系;在幻觉任务中,模型则需准确回答图像中实际不存在的物体数量。这些问题看似简单,却对模型的视觉感知能力构成了严峻挑战。

PerceptionBench 的开发团队强调,单一基准或少数几个基准只能捕捉感知错误的狭小片段,且这些片段之间重叠有限(平均成对加权 Jaccard 系数仅为 0.20)。因此,一个以能力为中心的、能聚合并平衡这些碎片化视角的基准至关重要。通过提供一个标准化的测评框架,PerceptionBench 有望推动多模态 AI 在视觉感知领域取得实质性进步。

目前,PerceptionBench 的数据集和评估代码已在 GitHub 上开源,供全球研究人员使用。团队希望这一基准能够帮助社区更好地理解和解决视觉感知的瓶颈问题,最终实现更可靠、更一致的多模态视觉理解。