PerceptionBench:评估多模态大语言模型的原子视觉感知能力
PerceptionBench是一个专门设计用于评估多模态大语言模型(MLLMs)原子视觉感知能力的基准。它通过自下而上的方法,从42个现有基准中构建错误分类法,定义十种原子感知能力,并创建3000个可验证问题。对16个前沿MLLMs的测试显示,没有模型达到60%的准确率,感知相关幻觉是最薄弱的环节。
PerceptionBench是一个专为评估多模态大语言模型(MLLM)原子视觉感知能力而设计的基准测试。当前的主流评估方法存在明显缺陷:整体性评估将感知错误与推理或领域知识失败混为一谈,而应用驱动的基准只覆盖由启发式设计塑造的狭窄、碎片化领域。为了解决这些问题,研究团队采用自下而上的方法,通过分析前沿MLLM在42个现有基准上的最早失败点,构建了一个错误分类体系。该体系的感知分支定义了十种原子感知能力,包括颜色感知、形状感知、空间关系感知、纹理感知、大小感知、方向感知、数量感知、运动感知、亮度感知和图案感知。基于这一分类法,他们创建了3000个经过验证的问题,每个问题答案简短明确,仅测试单一能力,难度源于感知层面而非推理或知识。在16个前沿MLLM上的测试结果表明,原子感知问题远未解决:没有任何模型的准确率超过60%,与感知相关的幻觉平均而言是最薄弱的能力。此外,相似的整体得分往往掩盖了模型间截然不同的能力轮廓。例如,某些模型在空间感知上表现出色,但在颜色感知上表现糟糕。PerceptionBench提供了一个能力级别的标准,用于测量和诊断MLLM的视觉感知边界。该基准的发布为研究人员提供了新的视角,有助于识别和解决模型的感知瓶颈。未来,研究团队计划扩展感知类别,引入动态场景,并探索与推理能力的交互。这项工作对于推动更可靠、更强大的视觉基础模型具有重要意义。同时,该基准也揭示了当前MLLM在低级视觉感知上的局限性,为后续模型的改进指明了方向。