跳到主要內容
AI News HubLIVE
站內改寫3 分鐘閱讀

Claude 文本水印技術原理解析

文章摘要

Anthropic 宣佈,未來 Claude 模型生成的文本將包含水印,以符合歐盟《人工智能法案》。該水印技術不會影響文本質量、可讀性或成本,讀者無法察覺差異,也不包含任何可追蹤的個人或組織信息。文章詳細解釋了水印的工作原理、侷限性、對代碼和編輯場景的影響,以及檢測 API 等內容。

Claude 文本水印技術原理解析
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Anthropic 宣佈,未來版本的 Claude 模型將在生成的文本中嵌入水印,以幫助識別內容是否由 Claude 生成。這一變化是為了遵守歐盟《人工智能法案》,該法案自 2026 年 8 月起要求 AI 提供商標記 AI 生成的內容。Anthropic 表示,水印技術不會影響文本質量,不會增加使用成本,讀者也完全無法察覺差異。

水印的原理基於語言模型生成文本時的隨機選擇機制。例如,在“今天的天氣寒冷而……”這個句子中,下一個詞是“陰天”還是“灰色”都是合理的選擇,模型通常會在這種低風險情境下依靠隨機數決定。水印方法改變了隨機數的來源:不再使用任意隨機數生成器,而是使用一個密鑰以及前面的幾個詞來做出選擇。這樣一來,模型選出的詞仍然是隨機的,但持有密鑰的人可以檢查文本序列是否與密鑰生成模式一致,從而判斷文本是否出自 Claude。

這種技術不會迫使模型選擇它本來不會考慮的詞。例如,它不會讓 Claude 使用“nubilous”這樣生僻的同義詞。水印也不會在文本中添加額外內容或隱藏字符,不會產生額外 token,因此模型速度和服務成本都不受影響。

在內部測試中,Anthropic 沒有發現水印對文本內容、創意性或可讀性有任何影響。Google DeepMind 在 SynthID-Text 論文中提到,他們在一部分 Gemini 流量中啓用水印,用户點贊和點踩沒有統計學顯著差異;人工評測者也看不出水印版本和普通版本的質量差別。

一個有用的比喻是玩大富翁遊戲:玩家通常擲骰子決定移動步數,但如果改用圓周率數字序列來產生隨機數,每個玩家的行動仍然是隨機的,遊戲結果也不會改變。只不過,如果事後能看到所有移動步驟並知道這個規則,就可以判斷這局遊戲是否使用了圓周率。Claude 的水印也是同理,讀者體驗不變,但事後可以驗證文本是否很可能由 Claude 生成。

Claude 的文本水印是 Google DeepMind 在 2024 年 Nature 論文中提出的 SynthID-Text 方法的一個版本,該方法源於 Scott Aaronson 在 2022 年的提議。這類方法的設計原則相同:只改變隨機詞選擇的來源。然而水印存在侷限性,它只能回答“這段文本有多大可能是 Claude 寫的?”,無法確認文本是否由人類撰寫,也無法判斷是不是另一個 AI 寫的——即使其他 AI 也使用水印,它們會有不同的密鑰。短文或詞選擇空間較小的段落中,水印可靠性較低;隨着文本長度增加,判斷的置信度也會提高。

在事實性很強的內容中,水印會比較稀疏。例如在“艾薩克·牛頓最著名的作品叫《自然哲學的數學原理》……”這句話後面,下一個詞只能接“(Mathematica)”,水印沒有可作用的餘地。同樣,如果用户讓 Claude 只做語法和標點潤色,水印只能附着在少量修改詞上,可能不足以檢測。Claude 寫的內容越多,可供水印發揮作用的選擇就越多。

對於代碼來説,由於很多地方要求精確,水印也較少。但代碼中的註釋或任意命名等存在選擇空間的地方,水印仍然可以起作用,但對實際代碼的影響可以忽略不計。

用户無需擔心水印會降低速度或增加費用,它的影響可以忽略不計。水印也不會泄露任何身份信息——密鑰和輸出中不包含與用户、組織或對話相關的內容。Anthropic 正在全球範圍內部署水印,目前還沒有按地區劃分的持久方案,因此會在所有地區啓用,並繼續評估其他方法。

為什麼 Anthropic 要這樣做?直接原因是為了遵守歐盟《人工智能法案》。Anthropic 與其他多家大型 AI 提供商以及約 190 個簽署方在 2026 年 7 月簽署了歐盟《AI 生成內容透明度實踐準則》,要求 AI 系統提供商對 AI 生成文本進行“標記”。

關於其他常見問題,Anthropic 透露:文本水印檢測 API 即將推出,具體實現細節仍在制定中。對於 Claude 生成的圖片或 SVG 等文件,Claude 會在文件元數據中添加一個小的加密簽名內容憑證,標明文件由 Claude 生成或處理,這採用行業標準 C2PA,相機和修圖軟件也在用。該憑證不改變文件本身,也不包含個人身份信息。

如果有人試圖編輯文本去除水印,輕度編輯不會完全移除,但完全重寫會去掉水印——不過這種文本還能否算作 AI 生成,本身是個值得討論的問題。水印只能説明 Claude 可能參與了內容創作,無法區分“Claude 寫了全文”和“Claude 深度編輯過”。Claude 翻譯的內容也包含水印,因為每個詞都由 Claude 選擇。歐盟法律為 2026 年 8 月 2 日之前發佈的 Anthropic 模型設置了過渡期,Anthropic 正在為這些舊模型逐步添加水印,預計未來幾個月內完成。

與傳統 AI 檢測軟件(如 Pangram)不同,水印檢測使用 Anthropic 持有的密鑰,因此原理上更可靠;而檢測軟件無法訪問密鑰,只能依賴統計特徵等方法。

展開要點與分析

文章情報

工程師進階

要點

  • Claude 未來模型將使用基於 SynthID-Text 的水印技術,通過改變低風險詞選擇的隨機來源來標記內容,不影響輸出質量。
  • 水印對讀者完全不可見,不添加隱藏字符,不增加 token 或費用,也無法追溯到具體用户或組織。
  • 水印僅提供 Claude 參與生成的概率判斷,在短文本、事實性內容或輕度編輯場景中可能無法可靠檢測。
  • 除文本外,Claude 生成的文件將使用 C2PA 內容憑證;文本水印檢測 API 即將推出。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。