SAGA:生成式AI視頻的來源歸因(識別所用模型)
SAGA(生成式AI視頻來源歸因)是首個大規模框架,能夠識別生成特定AI視頻的具體模型,而非僅判斷真偽。它提供五個粒度的歸因層級:真實性、生成任務(文本到視頻/圖像到視頻)、模型版本、開發團隊和精確生成器。通過新穎的視頻Transformer架構和數據高效的預訓練-歸因策略,SAGA僅需每類0.5%的標註數據即達到全監督性能,並引入時間注意力簽名(T-Sigs)提供可解釋性。
隨着生成式AI技術的飛速發展,超逼真的合成視頻大量湧現,這加劇了被濫用的風險,而傳統的真假二分類檢測器已力不從心。為此,研究人員提出了SAGA(Source Attribution of Generative AI videos),這是首個大規模針對AI生成視頻進行來源歸因的綜合框架。與僅僅判斷視頻是否由AI生成不同,SAGA能夠精確識別出生成該視頻的具體模型。
SAGA的創新在於提供多粒度的歸因能力,涵蓋五個層級:真實性(真或假)、生成任務(如文本到視頻T2V或圖像到視頻I2V)、模型版本、開發團隊以及精確的生成器。這種細緻的分類為取證和監管提供了遠比簡單判別更為豐富的洞察。技術實現上,SAGA採用了一種新穎的視頻Transformer架構,該架構利用了強大視覺基礎模型的特徵,能夠有效捕捉時空偽影。
尤為關鍵的是,SAGA引入了一種數據高效的“預訓練-歸因”策略。實驗表明,僅需每類0.5%的標註數據,SAGA就能實現與全監督訓練相媲美的歸因性能,這大大降低了對大規模標註數據的依賴。此外,團隊還提出了時間注意力簽名(Temporal Attention Signatures,T-Sigs),這是一種全新的可解釋性方法,能夠可視化學習到的時序差異,首次解釋了為什麼不同視頻生成器會被區分開來。
在公共數據集上的大量實驗,包括跨域場景,證明了SAGA為合成視頻溯源設立了新的標杆。該工作為視頻取證、內容審核以及AI監管提供了關鍵的可解釋工具,具有重要的實際應用價值。