GenSyn10:用于基准测试图像分类的多生成式AI数据集
GenSyn10是一个包含6万张合成图像的数据集,与CIFAR-10对齐,使用三种架构不同的生成模型创建,旨在推进AI生成图像检测研究。评估显示,模型在已知生成器上表现良好,但在未知生成器上性能显著下降,凸显了分布外泛化的局限性。
随着生成式AI技术的飞速发展,其生成内容的检测能力却未能同步跟上,尤其是当检测器面对从未见过的生成模型时,性能往往大幅下降。为了填补这一研究空白,来自学术界的研究团队推出了GenSyn10——一个专门为基准测试图像分类而设计的多生成式AI合成图像数据集。该数据集与经典的CIFAR-10基准对齐,包含6万张32x32像素的彩色图像,覆盖10个物体类别,其中训练集5万张,测试集1万张。
GenSyn10的独特之处在于,它使用了三种架构截然不同的顶尖生成模型来生成图像:FLUX.2-dev(一种整流流Transformer)、HunyuanImage-3.0(混合专家MoE Transformer)和Qwen-Image-2512(多模态扩散Transformer)。研究团队通过基于模板的提示引擎生成图像,并统一降采样至32x32分辨率,以确保数据一致性。这一设计使得GenSyn10成为评估检测器对未知生成器泛化能力的标准化工具,解决了以往研究仅针对单一生成器进行测试的局限性。
在实验部分,研究团队评估了17种主流的图像分类模型,采用四阶段协议:真实数据基线、零样本迁移、微调以及保留测试。结果表明,尽管存在可测量的域间差距,但CIFAR-10训练模型在GenSyn10上零样本准确率最高可达96.86%,经过微调后更是提升至99.88%。然而,在区分真实图像与合成图像的二分类任务中,微调模型对已知生成器生成的图像准确率高达97-99.9%,但对来自未知生成器的图像,准确率骤降至79-96%。这一显著差距凸显了分布外(OOD)泛化能力的持续瓶颈。
GenSyn10的发布为AI生成内容检测领域提供了一个受控且系统的基准平台,有助于推动鲁棒性、域适应以及跨生成器泛化等方向的研究。随着生成式AI的快速迭代,此类基准将成为确保技术安全与可信赖的重要工具。