GenSyn10:用於基準測試圖像分類的多生成式AI數據集
GenSyn10是一個包含6萬張合成圖像的數據集,與CIFAR-10對齊,使用三種架構不同的生成模型創建,旨在推進AI生成圖像檢測研究。評估顯示,模型在已知生成器上表現良好,但在未知生成器上性能顯著下降,凸顯了分佈外泛化的侷限性。
隨着生成式AI技術的飛速發展,其生成內容的檢測能力卻未能同步跟上,尤其是當檢測器面對從未見過的生成模型時,性能往往大幅下降。為了填補這一研究空白,來自學術界的研究團隊推出了GenSyn10——一個專門為基準測試圖像分類而設計的多生成式AI合成圖像數據集。該數據集與經典的CIFAR-10基準對齊,包含6萬張32x32像素的彩色圖像,覆蓋10個物體類別,其中訓練集5萬張,測試集1萬張。
GenSyn10的獨特之處在於,它使用了三種架構截然不同的頂尖生成模型來生成圖像:FLUX.2-dev(一種整流流Transformer)、HunyuanImage-3.0(混合專家MoE Transformer)和Qwen-Image-2512(多模態擴散Transformer)。研究團隊通過基於模板的提示引擎生成圖像,並統一降採樣至32x32分辨率,以確保數據一致性。這一設計使得GenSyn10成為評估檢測器對未知生成器泛化能力的標準化工具,解決了以往研究僅針對單一生成器進行測試的侷限性。
在實驗部分,研究團隊評估了17種主流的圖像分類模型,採用四階段協議:真實數據基線、零樣本遷移、微調以及保留測試。結果表明,儘管存在可測量的域間差距,但CIFAR-10訓練模型在GenSyn10上零樣本準確率最高可達96.86%,經過微調後更是提升至99.88%。然而,在區分真實圖像與合成圖像的二分類任務中,微調模型對已知生成器生成的圖像準確率高達97-99.9%,但對來自未知生成器的圖像,準確率驟降至79-96%。這一顯著差距凸顯了分佈外(OOD)泛化能力的持續瓶頸。
GenSyn10的發佈為AI生成內容檢測領域提供了一個受控且系統的基準平台,有助於推動魯棒性、域適應以及跨生成器泛化等方向的研究。隨着生成式AI的快速迭代,此類基準將成為確保技術安全與可信賴的重要工具。