AI水印證據未能滿足取證準備性:一項實證評估
一項新研究評估了三種LLM水印方法(KGW、Unigram、SynthID-Text)的取證可靠性,發現它們都無法滿足法庭證據標準。在846次釋義攻擊中,KGW和Unigram水印被100%移除,SynthID移除率達98.3%。此外,三種方法的假陰性率高達70-83%,且SynthID將5.4%的人類寫作文本誤判為AI生成。研究者提出了取證準備性評分(FRS)框架,但結論是這些水印配置不能提供法庭可接受的證據。
隨着歐盟《人工智能法案》和加利福尼亞州SB 942等法規要求大型語言模型(LLM)生成的內容必須帶有水印,一項新的實證研究對這些水印方法的取證可靠性提出了嚴重質疑。該研究由Saifur Rahman Tamim和Amir Labib Khan進行,評估了三種代表性水印技術——KGW、Unigram以及MarkLLM實現的SynthID-Text——是否符合Daubert證據可採性標準和NIST SP 800-86數字取證流程。
為了進行系統評估,研究者提出了一個包含12項標準、三個強制門檻和60分評分系統的取證準備性評分(FRS)框架。他們選擇保留語義的釋義作為攻擊向量,因為這在法律上具有現實性,且難以被視為證據篡改。實驗使用15個不同提示對每種方法進行了846次有效釋義測試。
結果令人震驚:所有最初檢測到水印的KGW和Unigram文本在釋義後完全丟失了水印——即100%的條件移除率。SynthID僅略好,為98.3%。即使在未受攻擊的情況下,假陰性率也高得驚人:KGW為70%,Unigram為83%,SynthID為80%。此外,SynthID配置將5.4%的釋義人類寫作文本誤判為AI生成,並表現出18.6%的悖論率——其80%的原始水印輸出落入不確定性死區。這意味着在正常使用中,大多數帶水印的輸出也無法被可靠檢測。
在Daubert因素的評估中,三種方法沒有一種能滿足五個因素中的兩個以上。研究還發現,儘管FRS評分系統按設計運行,但它無法完全捕捉取證上的無用性——這對未來框架設計是一個值得注意的侷限性。例如,即使方法在某些項目上得分,整體上仍可能無法用於法庭。
論文作者總結道,這些經測試的配置無法達到法庭要求的證據標準。他們強調,監管機構在強制推行水印之前,必須確保底層技術具備真正的取證可靠性。該研究已提交至2026年AAAI/ACM人工智能、倫理與社會會議(AIES),並將在9頁論文中展示4張圖表,詳細説明實驗設計和結果。