ElevenLabsが生成した音声をSynthIDで検出
ElevenLabsはGoogle DeepMindと提携し、AI生成音声にSynthIDデジタルウォーターマークを埋め込む。この透かしは人間の耳には聞こえず、トリミング、速度変更、メタデータ削除、フォーマット変換後も残る。今週から無料ユーザーのテキスト読み上げ生成に導入し、数週間以内に全音声生成に拡大予定。無料のElevenLabs Audio Detectorも公開し、誰でも音声の出所を検証可能にし、透明性と説明責任を強化する。
AIによる音声生成の品質が急速に向上する中、人間の声と合成音声を区別することが難しくなっています。ElevenLabsは、ユーザーがAIとやり取りしていることを認識できるようにするため、Google DeepMindと協力してSynthIDデジタルウォーターマークを自社の生成音声に埋め込むことを発表しました。SynthIDは人間の耳には聞こえない音声パターンであり、音声をトリミングしたり、速度を変えたり、メタデータを削除したり、ファイル形式を変換した後でも検出可能です。今週から無料ユーザーのテキスト読み上げ生成にSynthIDが含まれ始め、今後数週間でElevenLabsの全音声生成に拡大される予定です。
透明性と説明責任を強化するため、ElevenLabsは無料のオーディオ検出ツール「ElevenLabs Audio Detector」も公開しました。このツールはSynthIDを利用して、音声クリップがElevenLabsによって生成されたものかどうかを誰でも検証できるようにします。同社は既にAI音声分類器とユーザー追跡システムを持っていますが、SynthIDはさらに強力な帰属機能を提供し、悪意のある行為者が安全対策を突破して説得力のあるディープフェイクを作成した場合に適切な行動を取ることを可能にします。多くの法域でAI生成コンテンツに機械可読なマークを付けることが義務化されつつある中、SynthIDは既存のC2PAクレデンシャルなどの出所・コンプライアンスツールと相互補完的に機能します。
技術的には、SynthIDは音声クリップに人間の耳には知覚できない音のパターンを隠すことで動作します。各音声ファイルには独自のパターンが割り当てられ、圧縮、クリッピング、速度変更などの一般的な変換後もパターンは保持されます。ElevenLabsのベンチマークでは、SynthIDはすべての技術要件を満たしました:初回バイト時間の遅延なし、高い検出率と低い誤検出率、一般的な変換に対する頑健性、人間の耳には知覚できず音質劣化なし、そしてElevenLabsが生成していない音声にコピーできないことです。
将来に向けて、ウォーターマーキングは透明性と説明責任だけでなく、新たな製品機能も可能にします。例えば、クリエイターや知的財産権保有者はコンテンツに直接メタデータを埋め込み、YouTube、Instagram、TikTokなどのプラットフォームで再配布された著作権素材を検出し、対処できるようになります。ElevenLabsは、モデルがより強力でリアルになるにつれて、説明責任インフラも進化する必要があると述べ、コンテンツの出所帰属がより信頼できる情報エコシステムの構築に貢献すると強調しています。