本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

Claudeのテキスト透かしの仕組み

記事の要約

Anthropicは、将来のClaudeモデルがEU AI法に準拠するため、生成テキストに透かしを埋め込むと発表しました。この透かし技術は、出力の品質や可読性、コストに実質的な影響を与えず、読者は違いを認識できません。また、個人や組織を特定する情報は含まれません。本記事では、仕組み、限界、コードや編集への影響、検出APIなどについて詳しく説明しています。

Claudeのテキスト透かしの仕組み
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Anthropicは、将来のClaudeモデルが生成するテキストに透かしを埋め込むと発表しました。これは、AI生成コンテンツのマークを義務付けるEU AI法に準拠するためです。2026年8月以降、EU市場にサービスを提供するAIプロバイダーはAI生成コンテンツにマークを付ける必要があり、Anthropicを含む複数の主要AI企業が同じ行動規範に署名しています。この透かしは、テキストの品質やユーザー体験に一切影響を与えず、コストや速度の面でも実質的なデメリットはありません。

透かしの仕組みは、大規模言語モデルが単語を選ぶ際のランダム性を利用します。たとえば「今日の天気は寒く、そして...」という文では、次に来る単語は「曇り」や「灰色」などが自然で、モデルは通常ランダムに選択します。透かしを有効にすると、この選択のランダム性の源泉が変わります。任意の乱数生成機の代わりに、秘密鍵と直前の数語を使って次の単語を選ぶのです。その結果、選ばれる単語は依然としてランダムですが、鍵を持つ人はテキストの語順をチェックし、Claudeが鍵を使って生成したかどうかを高い確率で判定できます。

ただし、この方法はモデルが通常選ばないような不自然な単語を強制するものではありません。また、テキストに追加の文字を埋め込んだり、隠し文字を入れたりすることもありません。余分なトークンが生成されないため、サービス提供コストが増えることもなく、モデルの速度にも影響はほとんどありません。

Google DeepMindがSynthID-Textで行った評価では、水印付きモデルと通常モデルの間でユーザーの評価に統計的有意差は見られませんでした。Anthropicの内部テストでも、コンテンツの質、創造性、読みやすさへの影響は確認されていません。これは、モノポリーでサイコロの代わりに円周率の数字列を使ってランダムな移動を決めるようなものです。プレイヤーにとって動きは依然としてランダムであり、ゲームの結果も変わりませんが、後から全員の移動を見れば、円周率を使ったゲームかどうかを判別できます。

Claudeのテキスト透かしは、Google DeepMindが2024年にNatureで発表したSynthID-Textのアプローチに基づいており、Scott Aaronsonが2022年に提案した手法の系譜に属します。設計原則は同じで、単語を選択する際のランダム性の源泉だけを変えます。透かしには限界もあります。鍵を使えるのは「Claudeがこのテキストを書いた可能性」を確率的に示すだけで、人間が書いたかどうかや、別のAIが書いたかどうかは判定できません。別のAIが別の鍵や方式を使っていれば、それも分かりません。短文では単語選択の数が少ないため検出が難しく、長い文章ほど信頼度が上がります。

事実に基づく文章では、選択の余地が少ないため透かしはまばらになります。例えば「アイザック・ニュートンの最も有名な著書はプリンキピア...」の次に来る語は「マテマティカ」でほぼ決まっており、透かしは機能しません。校正や文法修正のみを依頼した場合も、修正された少数の単語にしか透かしが入らず、検出が難しい可能性があります。Claudeが多くの単語を書けば書くほど、透かしの入る余地が増えます。

コードについても、正確さが求められる部分では透かしはあまり機能しません。「2 + 2 =」の後に「4」以外の答えはありえないからです。ただし、コード内のコメントや命名など、任意の選択が許される箇所では透かしを適用できますが、実際のコードへの影響はごくわずかです。

ユーザーにとって、透かしは速度を遅くせず、費用も増やしません。また、透かしや鍵から個人や組織、チャットの情報が漏れることはありません。Anthropicは地域ごとに適用範囲を限定する方法がまだ確立していないため、グローバルに透かしを適用します。

Anthropicがこの変更を行う理由は、EU AI法への準拠です。同社は2026年7月、他の主要AIプロバイダーや約190の署名者とともに、EUの「AI生成コンテンツの透明性に関する行動規範」に署名しました。今後、テキスト透かし検出APIを提供する予定で、実装の詳細を検討中です。

画像やSVGなどのファイルについては、ClaudeはファイルメタデータにC2PAコンテンツクレデンシャルと呼ばれる暗号署名付きの小さなメモを添付します。これはカメラや写真編集ソフトでも使われているオープンな業界標準で、ファイル自体を変更せず、個人を特定する情報も含まれません。

軽い編集では透かしは完全には消えませんが、全単語を置き換える完全な書き換えでは消えてしまいます。後者の場合、そのテキストをAI生成と呼べるかは議論の余地があります。透かしは「Claudeが関与した可能性」を示すだけで、全文をClaudeが書いたのか、深く編集したのかを区別することはできません。Claudeが翻訳したテキストには、すべてClaudeが単語を選ぶため透かしが入ります。

2026年8月2日より前に発売された旧Claudeモデルには移行期間が設けられており、Anthropicは今後数ヶ月かけてこれらのモデルにも透かし機能を追加する予定です。Pangramのような従来のAI検出ソフトウェアとは異なり、透かし検出はAnthropicの鍵を使って行うため、原理的に信頼性が高くなります。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 将来のClaudeモデルは、SynthID-Text系の透かしを使い、低リスクな語句選択のランダム性の源泉を変えることで、出力品質に影響を与えずにAI生成をマークします。
  • 透かしは読者には見えず、隠し文字や追加トークンもなく、コスト増もなく、ユーザーや組織にトレースできません。
  • 透かしはClaudeが関与した可能性を示すだけで、短文・事実重視の文章・軽い編集・コードでは信頼性が低くなります。
  • テキスト透かし検出APIがまもなく提供され、画像などのファイルにはC2PAコンテンツクレデンシャルが使われます。旧モデルにも数ヶ月かけて順次適用されます。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。