人間の話し方の特徴やニュアンスを捉えた表現豊かな音声体験を構築するには、より豊かで大規模なデータセットが必要です。Qwen3-TTSは数秒の音声からゼロショット音声クローンを行う優れた能力をすでに備えていますが、より高度なクローン機能を実現するには、より大規模な発話単位のデータセットによるファインチューニングが求められます。
クローズドソースのプロバイダーは、これを「インスタント音声クローン」ではなく「プロフェッショナル音声クローン」と呼ぶことが一般的です。事前に大規模なデータキュレーションが必要で、声優の起用などの作業も含まれます。著者らは、Baseten Trainingで単一話者のファインチューニング済みチェックポイントを作成するための、公式のQwen3-TTSトレーニングレシピを修正したバージョンをml-cookbookで公開しています。作成したチェックポイントはBaseten Cloudの専用デプロイメントとして簡単に展開できます。
記事では、3つの音声クローン手法を比較しています。ICLモードは、参照音声と参照テキストをトークン化し、すべてのリクエストにプレフィックスとして追加します。推論時に参照音声とテキストの関係を学習しますが、約数百トークンのprefillオーバーヘッドが発生します。さらに、注意機構の非決定性により話者の一貫性が損なわれる可能性があります。話者埋め込みのみのモードでは、ECAPA-TDNNが生成する約10トークンの埋め込みをプレフィックスとして使用するため、TTFAが低く、高並列環境でも有利ですが、埋め込み次元が小さいため話者再現性はやや劣ります。
ファインチューニングの目的は、ICLによる追加オーバーヘッドなしで、よりリッチなテキストと音声のアライメント関係を学習することです。具体的には、教師ありファインチューニング(SFT)で多数のテキスト・音声ペアを学習し、一部のペアにわたって蓄積された話者埋め込みに基づいて生成するようモデルを調整します。これにより、話者同一性がモデル重みに組み込まれ、推論時には参照音声の処理が完全に不要になります。
データセット構築では、長い音声ファイルをWhisperなどのASRで転写し、同時に文字レベルのタイムスタンプを生成します。そのタイムスタンプを使って、終止符などの区切りで音声とテキストを分割し、発話単位の学習ペアを作成します。サンプルではLJ Speechデータセットを使用しており、約24時間の単一話者音声が含まれますが、実際のデータ制約を模倣するため、約1.5時間(800クリップ)のみでファインチューニングしています。
トレーニングでは、Qwen3-TTSのマルチコードブックRVQ表現を利用します。生の波形はサンプルごとに予測すると系列長と計算量が爆発するため、ベクトル量子化を反復的に適用し、1秒あたり12コーデックフレーム、各フレーム16コードブックの表現を得ます。損失は、話者損失(talker loss)とサブ話者損失(sub-talker loss)に分かれます。talker lossは最初のコードブックの交差エントロピーで、音韻・韻律情報の大部分を担います。sub-talker lossは残り15コードブックの損失で、より詳細な音響情報を捉えます。重みは上流のデフォルトである0.3を使用しています。
話者埋め込みの導出も改良しています。単一の参照クリップを使うのではなく、凍結した話者エンコーダーで64のトレーニングクリップを処理し、その平均(重心)を埋め込みとして使用します。同一話者のクリップ間のコサイン類似度は約0.7ですが、重心との類似度は0.85以上になるため、より安定したターゲットとなります。重心埋め込みはチェックポイントに直接組み込まれるため、推論時の参照音声選択への感度も解消されます。
さらに、線形ウォームアップとコサイン学習率減衰を追加しました。TTSファインチューニングは学習率に敏感で、1e-5を超えると小規模な音声データセットでは話者品質が低下しやすくなります。平坦なスケジュールは初期の過大調整と後期の過学習を引き起こすため、ウォームアップとコサイン減衰の組み合わせが効果的です。
実験では、約1.5時間のLJ Speechデータ(800クリップ)を使用し、単一のH100で約1時間、8エポックの学習を行いました。ファインチューニングされたモデルのTTFAは約130msで、話者埋め込みのみのモードに匹敵し、ICLの約154msより約16%高速です。ただし、1.5時間のデータでは、類似度やMOS品質でゼロショットを大幅に上回るわけではありません。その価値は、参照音声が不要で拡張時のレイテンシが安定するという運用面と、ゼロショットでは平坦になりがちなプロンプトで表現力が向上するという知覚面にあります。データセットが数時間を超えて成長すると、改善余地はさらに大きくなります。
将来の方向性として、DPOやGRPOなどの強化学習報酬信号をポストトレーニングに組み込むことや、EmergentTTSやTTSDSv2のような自動評価指標の活用が期待されています。発音や感情のより細かい制御も重要であり、これらの機能をオープンソースモデルにファインチューニングで組み込む研究が有望です。