本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

Gradiumが「Voice Design」を発表:プロンプトを書くと数秒で新しい合成音声を生成

記事の要約

Kyutai研究所からスピンアウトしたパリ拠点の音声AI企業Gradiumは、テキストで音声を説明するだけで、参照音声や権利処理なしに数秒で新しい合成音声を1〜5件生成できる「Voice Design」を発表した。APIとStudioで全プラン無料提供。5言語に対応し、Gradiumが実施したブラインドテストではElevenLabsなどを抑えて首位となった。

ソースMarkTechPost著者: Michal Sutter
Gradiumが「Voice Design」を発表:プロンプトを書くと数秒で新しい合成音声を生成
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

音声エージェントのチームは常に同じ壁にぶつかる。カタログには400の音声があるのに、依頼はカタログにない声を求めてくる。モントリオールの自動車販売店向けのケベック訛りの受付係、講堂で説得力のある60代のナレーター。依頼の数はカタログを上回り、クローニングは一人の話者ずつギャップを埋めるが、そのたびに音源の調達、同意、ライセンスが必要になる。

パリを拠点とする音声AI企業Gradiumは、Kyutai研究所からスピンアウトした会社だが、別の解決策を出した。Voice Designは、書かれた説明文を読んで、数秒でまったく新しい音声を返す。参照音声も、話者も、権利処理も必要ない。この機能はGradium APIとStudioで公開されており、無料プランを含むすべてのプランで無料で使える。保存した音声は、カタログの音声と同じストリーミングTTSエンドポイントで、同じレイテンシと出力形式で利用できる。

説明文が唯一の入力だ。公式ドキュメントには、モデルが対応する属性が列挙されており、それはキャスティングの要項のように読める:性別、年齢層、アクセント・出身、ピッチ、速さ、エネルギー、音色・共鳴、言葉遣い・態度、そしてその音声が担う仕事。説明文は英語、フランス語、スペイン語、ポルトガル語、ドイツ語で1〜500文字。末尾に用途を書くと、声色だけでなく話し方やトーンにも影響するため、推奨されている。

1リクエストにつき1〜5件の候補が返り、通常3〜5秒で生成される。候補は同じキャラクターのバリエーションなので、別のキャラクターが欲しい場合は別の説明文を書く必要があり、追加サンプルを求めても解決しない。

候補から本番音声までの流れは4回のAPIコールだ。POST /voice-generator/generateで候補IDを作成(状態はready: false)。GET /voice-generator/embeddingsで準備完了になるまでポーリング。各候補は通常のTTSエンドポイントに候補IDをvoice_idとして指定して試聴できる。最後にPOST /voices/from-embeddingで採用した候補を正式な音声に昇格させる。

候補には3つの制限がある:試聴テキストは100文字まで、RESTのみ対応、TTS WebSocketとSpeech-to-Speechは拒否される。未変換の候補は30日後に削除される。変換は無料で、有効期限がなくなり、クローンと共有するカスタム音声スロットを1つ使用する。無料プランは5件、有料プランは1,000件まで保存できる。

サンプリングは意図的に非決定的だ。Gradiumチームはまず説明文を拡張し、その拡張はリクエストごとに変わるため、同じプロンプトでも、シードを固定しても、異なる音声が生成される。

Gradiumはブラインドのペアワイズリスニングテストを実施した。パブリックAPI経由で利用できる6つの音声デザインシステムを対象に、アクセントを含むプロンプトでテストし、母語話者がラベルなしの2つのクリップを聞いて近い方を選ぶか、引き分けにした。7,627回の比較で、Gradiumはフィールド全体に対して勝率72.6%を報告。ElevenLabsのeleven_ttv_v3は59.0%で13.6ポイント差、以下Inworld 44.8%、Fish Audio 36.7%、MiniMax 31.7%と続いた(勝率は勝利数に引き分けの半分を加えた値で、50%が基準)。Gradiumは5言語すべてで1位だった。最も差が大きかったのは、ほとんどのカタログが平坦化してしまう地域アクセントだった:ケベックフランス語97%、リオプラテンセ・スペイン語86%、バイエルン・ドイツ語85%、コロンビア・スペイン語とアフリカポルトガル語83%。同じプロンプトセットをモデル審査員のGemini 3.1 Proが1〜5点で評価した結果も同じ順位だった:Gradium 4.06、ElevenLabs 3.86、Inworld 3.64、Fish Audio 3.51。さらに、製品ページはInstructTTSEvalの英語分割におけるプロンプト遵守率が83.4%だと主張している。(注:これらの数値はすべてベンダー設計・ベンダー実施である。)

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • Voice Designは最大500文字の音声説明から、参照音声なしで3〜5秒で1〜5件の新規音声を生成する。
  • APIとStudioで全プラン無料で利用でき、英語・フランス語・スペイン語・ポルトガル語・ドイツ語に対応。
  • Gradiumのブラインドペア比較テストでは7,627回の比較で勝率72.6%を記録し、ElevenLabsの59.0%を上回った。
  • 変換した音声は通常のvoice_idとしてREST・WebSocket・Speech-to-Speechで利用可能。未変換候補は30日後に削除される。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。