SAGA:生成式AI影片的來源歸因(識別所用模型)
SAGA(生成式AI影片來源歸因)是首個大規模框架,能夠識別生成特定AI影片的具體模型,而非僅判斷真偽。它提供五個粒度的歸因層級:真實性、生成任務(文本到影片/影像到影片)、模型版本、開發團隊和精確生成器。透過新穎的影片Transformer架構和資料高效的預訓練-歸因策略,SAGA僅需每類0.5%的標註資料即達到全監督效能,並引入時間注意力簽名(T-Sigs)提供可解釋性。
隨著生成式AI技術的飛速發展,超逼真的合成影片大量湧現,這加劇了被濫用的風險,而傳統的真假二分類檢測器已力不從心。為此,研究人員提出了SAGA(Source Attribution of Generative AI videos),這是首個大規模針對AI生成影片進行來源歸因的綜合框架。與僅僅判斷影片是否由AI生成不同,SAGA能夠精確識別出生成該影片的具體模型。
SAGA的創新在於提供多粒度的歸因能力,涵蓋五個層級:真實性(真或假)、生成任務(如文本到影片T2V或影像到影片I2V)、模型版本、開發團隊以及精確的生成器。這種細緻的分類為取證和監管提供了遠比簡單判別更為豐富的洞察。技術實現上,SAGA採用了一種新穎的影片Transformer架構,該架構利用了強大視覺基礎模型的特徵,能夠有效捕捉時空偽影。
尤為關鍵的是,SAGA引入了一種資料高效的“預訓練-歸因”策略。實驗表明,僅需每類0.5%的標註資料,SAGA就能實現與全監督訓練相媲美的歸因效能,這大大降低了對大規模標註資料的依賴。此外,團隊還提出了時間注意力簽名(Temporal Attention Signatures,T-Sigs),這是一種全新的可解釋性方法,能夠視覺化學習到的時序差異,首次解釋了為什麼不同影片生成器會被區分開來。
在公共資料集上的大量實驗,包括跨域場景,證明了SAGA為合成影片溯源設立了新的標杆。該工作為影片取證、內容稽核以及AI監管提供了關鍵的可解釋工具,具有重要的實際應用價值。