AI News HubLIVE
站內改寫1 分鐘閱讀

Venus-DeFakerOne:統一的偽造圖像檢測與定位

研究者提出了DeFakerOne,一個統一的偽造圖像檢測與定位(FIDL)基礎模型,整合了InternVL2和SAM2,能夠同時進行圖像級檢測和像素級定位,在39個檢測基準和9個定位基準上達到最優性能,並對GPT-Image-2等生成器具有魯棒性。

來源arXiv Computer Vision作者: GuangJian Team

近年來,生成式AI技術的飛速發展徹底改變了圖像偽造的範式,打破了傳統文檔編輯、自然圖像處理、深度偽造生成以及全圖AIGC合成之間的界限。儘管偽造生成機制呈現出統一化的趨勢,但現有的偽造圖像檢測與定位(FIDL)研究卻仍然分散在不同領域,導致通用生成模型與領域特定檢測範式之間存在嚴重錯配。為了解決這一問題,研究團隊提出了DeFakerOne——一個以數據為中心的統一FIDL基礎模型。

DeFakerOne創新性地整合了InternVL2和SAM2兩大模型,能夠同時進行圖像級別的偽造檢測和像素級別的偽造定位。這種聯合任務設計使其適用於廣泛的應用場景,從簡單的圖像篡改到複雜的深度偽造和AIGC合成圖像。實驗結果表明,DeFakerOne在39個偽造檢測基準和9個定位基準上均達到了最先進的性能,顯著超越了現有基線模型。更重要的是,該模型對真實世界中的各種擾動(如壓縮、縮放、噪聲等)以及最新生成器(包括GPT-Image-2)生成的高質量偽造圖像表現出極強的魯棒性。

除了模型本身,研究團隊還進行了系統性的分析,深入探討了數據縮放定律、跨域偽影的遷移與干擾模式、細粒度監督的必要性以及原始分辨率偽影的保留等問題。這些分析為構建可擴展、魯棒且統一的FIDL模型提供了重要的設計原則。DeFakerOne的成功不僅展示了統一FIDL模型的巨大潛力,也為應對日益複雜的圖像偽造威脅提供了切實可行的技術方案。