AI News HubLIVE
站内改写1 分钟阅读

Venus-DeFakerOne:统一的伪造图像检测与定位

研究者提出了DeFakerOne,一个统一的伪造图像检测与定位(FIDL)基础模型,整合了InternVL2和SAM2,能够同时进行图像级检测和像素级定位,在39个检测基准和9个定位基准上达到最优性能,并对GPT-Image-2等生成器具有鲁棒性。

来源arXiv Computer Vision作者: GuangJian Team

近年来,生成式AI技术的飞速发展彻底改变了图像伪造的范式,打破了传统文档编辑、自然图像处理、深度伪造生成以及全图AIGC合成之间的界限。尽管伪造生成机制呈现出统一化的趋势,但现有的伪造图像检测与定位(FIDL)研究却仍然分散在不同领域,导致通用生成模型与领域特定检测范式之间存在严重错配。为了解决这一问题,研究团队提出了DeFakerOne——一个以数据为中心的统一FIDL基础模型。

DeFakerOne创新性地整合了InternVL2和SAM2两大模型,能够同时进行图像级别的伪造检测和像素级别的伪造定位。这种联合任务设计使其适用于广泛的应用场景,从简单的图像篡改到复杂的深度伪造和AIGC合成图像。实验结果表明,DeFakerOne在39个伪造检测基准和9个定位基准上均达到了最先进的性能,显著超越了现有基线模型。更重要的是,该模型对真实世界中的各种扰动(如压缩、缩放、噪声等)以及最新生成器(包括GPT-Image-2)生成的高质量伪造图像表现出极强的鲁棒性。

除了模型本身,研究团队还进行了系统性的分析,深入探讨了数据缩放定律、跨域伪影的迁移与干扰模式、细粒度监督的必要性以及原始分辨率伪影的保留等问题。这些分析为构建可扩展、鲁棒且统一的FIDL模型提供了重要的设计原则。DeFakerOne的成功不仅展示了统一FIDL模型的巨大潜力,也为应对日益复杂的图像伪造威胁提供了切实可行的技术方案。