Artifact-Bench:評估多模態大語言模型檢測和判斷AI生成影片偽影的能力
Artifact-Bench是一個新基準,用於系統評估多模態大語言模型(MLLM)在檢測和分析AI生成影片偽影方面的表現。該基準建立了三級層次化的偽影分類體系,覆蓋真實感、動畫和CG風格影片,並定義了三個互補任務。對19個領先MLLM的實驗顯示,它們在偽影感知和推理方面存在嚴重缺陷,許多模型在挑戰性設定下表現近乎隨機甚至低於隨機,且與人類感知偏好存在顯著偏差。
來源arXiv Computer Vision作者: Yuqi Tang, Yang Shi, Zhuoran Zhang, Qixun Wang, Xuehai Bai, Yue Ding, Ruizhe Chen, Bohan Zeng, Xinlong Chen, Xuanyu Zhu, Bozhou Li, Yuran Wang, Yifan Dai, Chengzhuo Tong, Xinyu Liu, Yiyan Ji, Yujie Wei, Yuhao Dong, Shilin Yan, Fengxiang Wang, Yi-Fan Zhang, Haotian Wang, Yuanxing Zhang, Pengfei Wan
近年來,影片生成模型在提升AI生成影片的真實感方面取得了顯著進展,但生成的影片仍存在時間不一致、結構扭曲和語義不連貫等偽影。儘管多模態大語言模型(MLLM)展現出強大的視覺理解能力,但它們感知和推理這些偽影的能力尚不明確。現有的基準測試往往缺乏對偽影感知和細粒度診斷推理的系統評估,尤其是在真實感內容以外的多樣化AI生成影片領域。為填補這一空白,研究者提出了Artifact-Bench,一個全面的基準,用於評估MLLM在AI生成影片偽影檢測與分析方面的能力。
Artifact-Bench首先建立了一個三級層次化的真實感偽影分類體系,覆蓋真實感影片、動畫影片和CG風格影片。基於這一分類體系,基準定義了三個互補任務:真實影片與AI生成影片的分類、逐對真實感比較以及細粒度偽影識別。研究者在19個主流MLLM上進行了實驗,結果揭示了這些模型在偽影感知和推理方面存在顯著侷限性,許多模型在挑戰性設定下表現接近隨機甚至低於隨機水平。此外,研究還觀察到MLLM的判斷與人類感知偏好之間存在嚴重偏差,表明它們作為AI生成影片真實感的通用評估者其可靠性有限。
這項研究為未來改進MLLM在影片偽影檢測方面的能力提供了重要參考,並強調了開發更能對齊人類感知的評估方法的必要性。