Artifact-Bench:评估多模态大语言模型检测和判断AI生成视频伪影的能力
Artifact-Bench是一个新基准,用于系统评估多模态大语言模型(MLLM)在检测和分析AI生成视频伪影方面的表现。该基准建立了三级层次化的伪影分类体系,覆盖真实感、动画和CG风格视频,并定义了三个互补任务。对19个领先MLLM的实验显示,它们在伪影感知和推理方面存在严重缺陷,许多模型在挑战性设置下表现近乎随机甚至低于随机,且与人类感知偏好存在显著偏差。
来源arXiv Computer Vision作者: Yuqi Tang, Yang Shi, Zhuoran Zhang, Qixun Wang, Xuehai Bai, Yue Ding, Ruizhe Chen, Bohan Zeng, Xinlong Chen, Xuanyu Zhu, Bozhou Li, Yuran Wang, Yifan Dai, Chengzhuo Tong, Xinyu Liu, Yiyan Ji, Yujie Wei, Yuhao Dong, Shilin Yan, Fengxiang Wang, Yi-Fan Zhang, Haotian Wang, Yuanxing Zhang, Pengfei Wan
近年来,视频生成模型在提升AI生成视频的真实感方面取得了显著进展,但生成的视频仍存在时间不一致、结构扭曲和语义不连贯等伪影。尽管多模态大语言模型(MLLM)展现出强大的视觉理解能力,但它们感知和推理这些伪影的能力尚不明确。现有的基准测试往往缺乏对伪影感知和细粒度诊断推理的系统评估,尤其是在真实感内容以外的多样化AI生成视频领域。为填补这一空白,研究者提出了Artifact-Bench,一个全面的基准,用于评估MLLM在AI生成视频伪影检测与分析方面的能力。
Artifact-Bench首先建立了一个三级层次化的真实感伪影分类体系,覆盖真实感视频、动画视频和CG风格视频。基于这一分类体系,基准定义了三个互补任务:真实视频与AI生成视频的分类、逐对真实感比较以及细粒度伪影识别。研究者在19个主流MLLM上进行了实验,结果揭示了这些模型在伪影感知和推理方面存在显著局限性,许多模型在挑战性设置下表现接近随机甚至低于随机水平。此外,研究还观察到MLLM的判断与人类感知偏好之间存在严重偏差,表明它们作为AI生成视频真实感的通用评估者其可靠性有限。
这项研究为未来改进MLLM在视频伪影检测方面的能力提供了重要参考,并强调了开发更能对齐人类感知的评估方法的必要性。