AI News HubLIVE
站內改寫2 分鐘閱讀

OmniVoice-Studio入門指南

OmniVoice Studio是一款本地運行的免費開源語音AI桌面應用,支持646種語言,無需API密鑰,數據完全保留在本地。本文詳細介紹了從安裝到首次生成音頻的完整流程,包括系統要求、macOS/Windows/Linux安裝步驟、Hugging Face令牌設置、語音克隆操作等。

來源KDnuggets作者: Shittu Olumide

OmniVoice Studio是一款以本地運行為核心理念的開源語音AI桌面應用。與ElevenLabs等雲端服務不同,所有處理都在用户自己的硬件上完成,無需API密鑰,無使用次數限制,數據絕不離開設備。該項目自稱“ElevenLabs的開源替代品”,且語言支持數量驚人:ElevenLabs支持32種語言,而OmniVoice Studio支持646種。

該應用基於Tauri框架構建,後端為FastAPI,提供97個API端點,持久化狀態存儲在SQLite中。AI管線由四大開源組件驅動:WhisperX負責轉錄,Demucs進行人聲分離,OmniVoice(來自k2-fsa)實現零樣本擴散文本轉語音,Pyannote處理説話人分割。啓動時自動檢測GPU並相應調用CUDA、MPS、ROCm或CPU。

系統要求:最低8GB RAM、4GB VRAM(不足時TTS自動卸載至CPU)、10GB磁盤空間。推薦16GB+ RAM、8GB+ VRAM(如NVIDIA RTX 3060+)。無需GPU也可運行,但TTS合成速度約慢3倍。Apple Silicon Mac是無需GPU用户的最佳選擇,應用會自動利用MLX優化的Whisper和TTS後端。

安裝指南

  • macOS:需安裝Python 3.11+、Bun、Xcode Command Line Tools及FFmpeg。克隆倉庫後執行bun installbun run desktop-prod。首次啓動會下載約2.4GB的模型權重。預構建DMG用户若遇到Gatekeeper警告,可通過xattr -cr命令解除隔離。
  • Windows:需Windows 10 21H2+或Windows 11、Python 3.11+、Microsoft C++ Build Tools、Bun及FFmpeg。同樣克隆並運行bun run desktop-prod。若首次TTS合成時出現顯存不足(OOM),可在設置中禁用torch.compile或設置環境變量TORCH_COMPILE_DISABLE=1
  • Linux(Debian/Ubuntu):安裝Python、Bun、FFmpeg及GTK/WebKit依賴。Fedora用户需安裝相應包。克隆後運行相同命令。預構建AppImage可能出現白屏問題,設置WEBKIT_DISABLE_COMPOSITING_MODE=1可解決。Docker用户可僅運行後端API。

Hugging Face令牌:對於説話人分割和大型語音設計引擎,需免費註冊Hugging Face並獲取讀取令牌。可通過應用內設置或環境變量HF_TOKEN配置。還需在Hugging Face模型頁面接受pyannote/speaker-diarization-3.1的使用條款。

語音克隆:核心功能,由k2-fsa的OmniVoice模型驅動。無需微調,只需提供3-10秒清晰參考音頻。在“Voice Clone”選項卡中,可錄製或上傳音頻,模型即時適應説話人聲音。