AI News HubLIVE
サイト内リライト2 分で読了

OmniVoice-Studio入門ガイド

OmniVoice Studioは、完全にローカルで動作する無料のオープンソース音声AIデスクトップアプリで、646言語をサポートし、APIキーは不要です。この記事では、macOS、Windows、Linuxでのインストール手順、システム要件、Hugging Faceトークンの設定、音声クローン方法など、全プロセスを詳しく解説します。

ソースKDnuggets著者: Shittu Olumide

OmniVoice Studioは、すべての処理をユーザーのハードウェア上で行うことを前提に構築された、オープンソースの音声AIデスクトップアプリケーションです。ElevenLabsのようなクラウドサービスとは異なり、APIキーや使用回数制限はなく、データがデバイス外に出ることはありません。このプロジェクトは「ElevenLabsのオープンソース代替」を自称しており、言語カバレッジだけでも興味深い比較ができます。ElevenLabsが32言語をサポートするのに対し、OmniVoice Studioは646言語をサポートしています。

このアプリはTauriデスクトップフレームワーク上に構築され、Reactフロントエンドと97のAPIエンドポイントを持つFastAPIバックエンドをラップしています。永続状態はSQLiteに保存されます。AIパイプラインは4つのオープンソースコンポーネントで構成されています。WhisperXが文字起こしと単語レベルの音声認識、Demucsが音声分離、k2-fsaのOmniVoiceがゼロショット拡散テキスト読み上げ(TTS)エンジン、Pyannoteが話者ダイアリゼーションを担当します。GPUアクセラレーションは起動時に自動検出され、CUDA、MPS、ROCm、CPUのいずれかにルーティングされます。

システム要件:最低8GB RAM、4GB VRAM(不足時はTTSが自動的にCPUにオフロード)、10GBディスク容量。推奨は16GB+ RAM、8GB+ VRAM(NVIDIA RTX 3060+)。GPUは必須ではありませんが、TTS合成速度はGPUなしで約3倍遅くなります。Apple Silicon MacはGPUなしユーザーに最適で、アプリは自動的にMLX最適化のWhisperおよびTTSバックエンドを選択し、CPUパスと比較して約2倍のスループットを実現します。

インストールガイド

  • macOS:Python 3.11+、Bun、Xcode Command Line Tools、FFmpegをインストール後、リポジトリをクローンしてbun installbun run desktop-prodを実行。初回起動時には約2.4GBのモデルウェイトがダウンロードされます。プリビルドDMGユーザーは、Gatekeeper警告が表示された場合、xattr -crコマンドで隔離属性を解除できます。
  • Windows:Windows 10 21H2+またはWindows 11、Python 3.11+、Microsoft C++ Build Tools、Bun、FFmpegが必要。同様にクローンしてbun run desktop-prodを実行。初回TTS合成時にOOMエラーが発生した場合は、設定でtorch.compileを無効にするか、環境変数TORCH_COMPILE_DISABLE=1を設定します。
  • Linux(Debian/Ubuntu):Python、Bun、FFmpeg、GTK/WebKit依存関係をインストール。Fedoraの場合は対応するパッケージをインストール。クローン後、同じコマンドで実行。プリビルドAppImageで白画面が表示される場合は、WEBKIT_DISABLE_COMPOSITING_MODE=1を設定。Dockerを使用してバックエンドAPIのみを実行することも可能です。

Hugging Faceトークン:話者ダイアリゼーション(pyannote/speaker-diarization-3.1モデルはゲート付き)や大規模な音声デザインエンジンを使用するには、無料のHugging Faceアカウントと読み取りトークンが必要です。アプリ内設定または環境変数HF_TOKENで設定できます。また、Hugging Faceのモデルページで利用規約に同意する必要があります。

音声クローン:コア機能であり、多くの人がOmniVoiceをインストールする目的です。k2-fsaのOmniVoiceモデルを搭載し、ゼロショットで動作します。3~10秒のクリアな参照音声を提供するだけで、モデルが即座に話者の声に適応します。「Voice Clone」タブで、マイクボタンから録音するか、既存の音声ファイルをアップロードして使用します。