AI News HubLIVE
站内改写1 分钟阅读

PerceptionBench:评估多模态大语言模型的原子视觉感知能力

PerceptionBench是一个专门设计用于评估多模态大语言模型(MLLMs)原子视觉感知能力的基准。它通过自下而上的方法,从42个现有基准中构建错误分类法,定义十种原子感知能力,并创建3000个可验证问题。对16个前沿MLLMs的测试显示,没有模型达到60%的准确率,感知相关幻觉是最薄弱的环节。

来源arXiv Computer Vision作者: Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

PerceptionBench是一个专为评估多模态大语言模型(MLLM)原子视觉感知能力而设计的基准测试。当前的主流评估方法存在明显缺陷:整体性评估将感知错误与推理或领域知识失败混为一谈,而应用驱动的基准只覆盖由启发式设计塑造的狭窄、碎片化领域。为了解决这些问题,研究团队采用自下而上的方法,通过分析前沿MLLM在42个现有基准上的最早失败点,构建了一个错误分类体系。该体系的感知分支定义了十种原子感知能力,包括颜色感知、形状感知、空间关系感知、纹理感知、大小感知、方向感知、数量感知、运动感知、亮度感知和图案感知。基于这一分类法,他们创建了3000个经过验证的问题,每个问题答案简短明确,仅测试单一能力,难度源于感知层面而非推理或知识。在16个前沿MLLM上的测试结果表明,原子感知问题远未解决:没有任何模型的准确率超过60%,与感知相关的幻觉平均而言是最薄弱的能力。此外,相似的整体得分往往掩盖了模型间截然不同的能力轮廓。例如,某些模型在空间感知上表现出色,但在颜色感知上表现糟糕。PerceptionBench提供了一个能力级别的标准,用于测量和诊断MLLM的视觉感知边界。该基准的发布为研究人员提供了新的视角,有助于识别和解决模型的感知瓶颈。未来,研究团队计划扩展感知类别,引入动态场景,并探索与推理能力的交互。这项工作对于推动更可靠、更强大的视觉基础模型具有重要意义。同时,该基准也揭示了当前MLLM在低级视觉感知上的局限性,为后续模型的改进指明了方向。