AI News HubLIVE
站內改寫2 分鐘閱讀

OmniVoice-Studio入門指南

OmniVoice Studio是一款本地執行的免費開源語音AI桌面應用,支援646種語言,無需API金鑰,資料完全保留在本地。本文詳細介紹了從安裝到首次生成音訊的完整流程,包括系統要求、macOS/Windows/Linux安裝步驟、Hugging Face令牌設定、語音克隆操作等。

來源KDnuggets作者: Shittu Olumide

OmniVoice Studio是一款以本地執行為核心理念的開源語音AI桌面應用。與ElevenLabs等雲端服務不同,所有處理都在使用者自己的硬體上完成,無需API金鑰,無使用次數限制,資料絕不離開裝置。該專案自稱“ElevenLabs的開源替代品”,且語言支援數量驚人:ElevenLabs支援32種語言,而OmniVoice Studio支援646種。

該應用基於Tauri框架構建,後端為FastAPI,提供97個API端點,持久化狀態儲存在SQLite中。AI管線由四大開源元件驅動:WhisperX負責轉錄,Demucs進行人聲分離,OmniVoice(來自k2-fsa)實現零樣本擴散文本轉語音,Pyannote處理說話人分割。啟動時自動檢測GPU並相應呼叫CUDA、MPS、ROCm或CPU。

系統要求:最低8GB RAM、4GB VRAM(不足時TTS自動解除安裝至CPU)、10GB磁碟空間。推薦16GB+ RAM、8GB+ VRAM(如NVIDIA RTX 3060+)。無需GPU也可執行,但TTS合成速度約慢3倍。Apple Silicon Mac是無需GPU使用者的最佳選擇,應用會自動利用MLX最佳化的Whisper和TTS後端。

安裝指南

  • macOS:需安裝Python 3.11+、Bun、Xcode Command Line Tools及FFmpeg。克隆倉庫後執行bun installbun run desktop-prod。首次啟動會下載約2.4GB的模型權重。預構建DMG使用者若遇到Gatekeeper警告,可透過xattr -cr命令解除隔離。
  • Windows:需Windows 10 21H2+或Windows 11、Python 3.11+、Microsoft C++ Build Tools、Bun及FFmpeg。同樣克隆並執行bun run desktop-prod。若首次TTS合成時出現視訊記憶體不足(OOM),可在設定中停用torch.compile或設定環境變數TORCH_COMPILE_DISABLE=1
  • Linux(Debian/Ubuntu):安裝Python、Bun、FFmpeg及GTK/WebKit依賴。Fedora使用者需安裝相應包。克隆後執行相同命令。預構建AppImage可能出現白屏問題,設定WEBKIT_DISABLE_COMPOSITING_MODE=1可解決。Docker使用者可僅執行後端API。

Hugging Face令牌:對於說話人分割和大型語音設計引擎,需免費註冊Hugging Face並獲取讀取令牌。可透過應用內設定或環境變數HF_TOKEN配置。還需在Hugging Face模型頁面接受pyannote/speaker-diarization-3.1的使用條款。

語音克隆:核心功能,由k2-fsa的OmniVoice模型驅動。無需微調,只需提供3-10秒清晰參考音訊。在“Voice Clone”選項卡中,可錄製或上傳音訊,模型即時適應說話人聲音。