AIウォーターマーク証拠はフォレンジック準備性を満たさない:実証的評価
新しい研究では、3つのLLMウォーターマーク手法(KGW、Unigram、SynthID-Text)のフォレンジック信頼性を評価し、いずれも法廷の証拠基準を満たさないことが判明した。846回のパラフレーズ実行において、KGWとUnigramのウォーターマークは100%除去され、SynthIDは98.3%除去された。偽陰性率は70-83%で、SynthIDは人間が書いた対照テキストの5.4%をAI生成と誤分類した。研究者らはフォレンジック準備性スコア(FRS)フレームワークを提案したが、テストされた構成は法廷で許容される証拠を提供できないと結論付けた。
欧州連合のAI法やカリフォルニア州のSB 942などの規制により、大規模言語モデル(LLM)が生成するコンテンツにウォーターマークを付けることが義務付けられていますが、新たな実証研究により、これらのウォーターマーク手法のフォレンジック信頼性に深刻な疑問が投げかけられています。Saifur Rahman Tamim氏とAmir Labib Khan氏によるこの研究では、KGW、Unigram、MarkLLMによるSynthID-Textの実装という3つの代表的なウォーターマーク技術を、Daubert証拠許容性基準とNIST SP 800-86デジタルフォレンジックプロセスに照らして評価しました。
系統的な評価のために、研究者らは12の基準、3つの必須ゲート、60点満点の採点システムからなるフォレンジック準備性スコア(FRS)フレームワークを提案しました。攻撃ベクトルとして、法的に現実的で証拠改ざんとみなされにくい意味保存型のパラフレーズを選択しました。実験では、各手法に対して15の異なるプロンプトを用いて846回の有効なパラフレーズ実行を行いました。
結果は衝撃的でした。最初に検出されたKGWとUnigramのテキストは、パラフレーズ後に全てのウォーターマークが消失しました。つまり、100%の条件付き除去率です。SynthIDはわずかに良好で98.3%でした。攻撃を受けていない場合でも、偽陰性率は非常に高く、KGWで70%、Unigramで83%、SynthIDで80%でした。さらに、SynthID構成では、パラフレーズされた人間作成の対照テキストの5.4%をAI生成と誤判定し、18.6%のパラドックス率を示し、その80%の未加工ウォーターマーク出力が不確実性デッドバンドに該当しました。これは、通常の使用ではほとんどのウォーターマーク付き出力も確実に検出できないことを意味します。
Daubert因子の評価では、3つの手法のうち5つの因子のうち2つ以上を満たすものはありませんでした。また、FRSポイントベースの採点システムは設計通りに機能するものの、フォレンジック上の無用性を完全に捉えることはできないという、将来のフレームワーク設計にとって注目すべき限界も見つかりました。例えば、特定の項目で点数が取れても、全体として法廷で使用できない可能性があります。
論文の著者らは、テストされたこれらの構成は裁判所が要求する証拠基準を満たさないと結論付けています。彼らは、規制当局がウォーターマークを強制する前に、基盤技術が真正なフォレンジック信頼性を持つことを確認する必要があると強調しています。本研究は、2026年のAAAI/ACM人工知能・倫理・社会会議(AIES)に提出され、9ページの論文で4つの図を用いて実験デザインと結果を詳細に説明する予定です。