Anthropic 宣佈,未來版本的 Claude 模型將在生成的文本中嵌入水印,以幫助識別內容是否由 Claude 生成。這一變化是為了遵守歐盟《人工智能法案》,該法案自 2026 年 8 月起要求 AI 提供商標記 AI 生成的內容。Anthropic 表示,水印技術不會影響文本質量,不會增加使用成本,讀者也完全無法察覺差異。
水印的原理基於語言模型生成文本時的隨機選擇機制。例如,在“今天的天氣寒冷而……”這個句子中,下一個詞是“陰天”還是“灰色”都是合理的選擇,模型通常會在這種低風險情境下依靠隨機數決定。水印方法改變了隨機數的來源:不再使用任意隨機數生成器,而是使用一個密鑰以及前面的幾個詞來做出選擇。這樣一來,模型選出的詞仍然是隨機的,但持有密鑰的人可以檢查文本序列是否與密鑰生成模式一致,從而判斷文本是否出自 Claude。
這種技術不會迫使模型選擇它本來不會考慮的詞。例如,它不會讓 Claude 使用“nubilous”這樣生僻的同義詞。水印也不會在文本中添加額外內容或隱藏字符,不會產生額外 token,因此模型速度和服務成本都不受影響。
在內部測試中,Anthropic 沒有發現水印對文本內容、創意性或可讀性有任何影響。Google DeepMind 在 SynthID-Text 論文中提到,他們在一部分 Gemini 流量中啓用水印,用户點贊和點踩沒有統計學顯著差異;人工評測者也看不出水印版本和普通版本的質量差別。
一個有用的比喻是玩大富翁遊戲:玩家通常擲骰子決定移動步數,但如果改用圓周率數字序列來產生隨機數,每個玩家的行動仍然是隨機的,遊戲結果也不會改變。只不過,如果事後能看到所有移動步驟並知道這個規則,就可以判斷這局遊戲是否使用了圓周率。Claude 的水印也是同理,讀者體驗不變,但事後可以驗證文本是否很可能由 Claude 生成。
Claude 的文本水印是 Google DeepMind 在 2024 年 Nature 論文中提出的 SynthID-Text 方法的一個版本,該方法源於 Scott Aaronson 在 2022 年的提議。這類方法的設計原則相同:只改變隨機詞選擇的來源。然而水印存在侷限性,它只能回答“這段文本有多大可能是 Claude 寫的?”,無法確認文本是否由人類撰寫,也無法判斷是不是另一個 AI 寫的——即使其他 AI 也使用水印,它們會有不同的密鑰。短文或詞選擇空間較小的段落中,水印可靠性較低;隨着文本長度增加,判斷的置信度也會提高。
在事實性很強的內容中,水印會比較稀疏。例如在“艾薩克·牛頓最著名的作品叫《自然哲學的數學原理》……”這句話後面,下一個詞只能接“(Mathematica)”,水印沒有可作用的餘地。同樣,如果用户讓 Claude 只做語法和標點潤色,水印只能附着在少量修改詞上,可能不足以檢測。Claude 寫的內容越多,可供水印發揮作用的選擇就越多。
對於代碼來説,由於很多地方要求精確,水印也較少。但代碼中的註釋或任意命名等存在選擇空間的地方,水印仍然可以起作用,但對實際代碼的影響可以忽略不計。
用户無需擔心水印會降低速度或增加費用,它的影響可以忽略不計。水印也不會泄露任何身份信息——密鑰和輸出中不包含與用户、組織或對話相關的內容。Anthropic 正在全球範圍內部署水印,目前還沒有按地區劃分的持久方案,因此會在所有地區啓用,並繼續評估其他方法。
為什麼 Anthropic 要這樣做?直接原因是為了遵守歐盟《人工智能法案》。Anthropic 與其他多家大型 AI 提供商以及約 190 個簽署方在 2026 年 7 月簽署了歐盟《AI 生成內容透明度實踐準則》,要求 AI 系統提供商對 AI 生成文本進行“標記”。
關於其他常見問題,Anthropic 透露:文本水印檢測 API 即將推出,具體實現細節仍在制定中。對於 Claude 生成的圖片或 SVG 等文件,Claude 會在文件元數據中添加一個小的加密簽名內容憑證,標明文件由 Claude 生成或處理,這採用行業標準 C2PA,相機和修圖軟件也在用。該憑證不改變文件本身,也不包含個人身份信息。
如果有人試圖編輯文本去除水印,輕度編輯不會完全移除,但完全重寫會去掉水印——不過這種文本還能否算作 AI 生成,本身是個值得討論的問題。水印只能説明 Claude 可能參與了內容創作,無法區分“Claude 寫了全文”和“Claude 深度編輯過”。Claude 翻譯的內容也包含水印,因為每個詞都由 Claude 選擇。歐盟法律為 2026 年 8 月 2 日之前發佈的 Anthropic 模型設置了過渡期,Anthropic 正在為這些舊模型逐步添加水印,預計未來幾個月內完成。
與傳統 AI 檢測軟件(如 Pangram)不同,水印檢測使用 Anthropic 持有的密鑰,因此原理上更可靠;而檢測軟件無法訪問密鑰,只能依賴統計特徵等方法。