AI News HubLIVE
站內改寫2 分鐘閱讀

Anthropic的隱形水印能否遏制“AI垃圾內容”?研究人員仍持懷疑態度

Anthropic宣佈為Claude模型生成的文本添加隱形水印,圖片則附帶數字簽名元數據,以滿足歐盟《人工智能法案》的檢測要求。研究人員認為水印雖有助於發現部分濫用行為,但易於被去除或規避,對學術誠信的實際影響仍不確定。

來源Hacker News AI作者: pogue

開發Claude人工智能模型的Anthropic公司宣佈,自8月2日起,所有新發布的模型生成的文本都將被嵌入一種隱形水印,用於標記輸出內容由AI撰寫。同時,Claude生成的圖像在大多數情況下會附帶包含數字簽名的元數據,以證明該文件經過模型處理。

水印技術通過算法微調模型選詞方式,在文本中留下可統計檢測的痕跡。Anthropic表示,這種水印不會改變Claude回覆的“意義、質量或可讀性”,並且可能在某些編輯後仍然留存。

這一舉措是為了響應2024年正式通過的歐盟《人工智能法案》。自今年8月2日起,前沿AI模型提供商必須確保AI生成內容可被檢測,否則將面臨最高1500萬歐元(約合1700萬美元)或全球年營業額3%的罰款。8月2日後發佈的模型須立即滿足要求,而已在市場上的舊版本最遲須在12月2日前達標。Anthropic稱,水印將應用於全球範圍內Claude的輸出。

然而,水印的存在並不能揭示模型的具體用途。Anthropic指出,檢測到水印僅“提供了一個信號”表明內容出自Claude,但並不構成決定性證據,例如模型可能只被用來總結或翻譯人類原創觀點。同樣,缺少水印也不代表文本非AI生成。由於水印基於模型中詞選擇的細微變化模式,過短的片段或被改寫重述的內容可能不再攜帶信號。

這種水印對學術誠信的影響尚不明朗。伊利諾伊州埃文斯頓西北大學的元科學家裏斯·理查森表示,水印很容易被去除——例如使用另一模型轉寫——因此不太可能阻止有意者利用AI製造假論文或低質量“AI垃圾內容”。但匹茲堡賓夕法尼亞州卡內基梅隆大學研究科學評估的計算機科學家尼哈爾·沙阿指出,如果AI公司提供檢查水印的工具——正如Anthropic所説將要做的那樣——並且這些工具的誤報率足夠低,那麼某些不當使用AI的行為仍可被發現。

水印的一個應用案例是幫助期刊編輯或會議組織者執行同行評審中的“無AI”政策。2026年國際機器學習會議(ICML)在其兩個評審軌道之一中嘗試了此做法。會議組織者給用於評審的論文添加了水印,當AI被用於撰寫評審報告時會產生特徵性文本,並據此抓獲了506名違規評審員。沙阿表示:“這一經驗表明,雖然有些惡意使用AI的行為可能精心規避檢測,但更多人可能只是直接複製粘貼AI輸出。”