OmniVoice-Studio入门指南
OmniVoice Studio是一款本地运行的免费开源语音AI桌面应用,支持646种语言,无需API密钥,数据完全保留在本地。本文详细介绍了从安装到首次生成音频的完整流程,包括系统要求、macOS/Windows/Linux安装步骤、Hugging Face令牌设置、语音克隆操作等。
OmniVoice Studio是一款以本地运行为核心理念的开源语音AI桌面应用。与ElevenLabs等云端服务不同,所有处理都在用户自己的硬件上完成,无需API密钥,无使用次数限制,数据绝不离开设备。该项目自称“ElevenLabs的开源替代品”,且语言支持数量惊人:ElevenLabs支持32种语言,而OmniVoice Studio支持646种。
该应用基于Tauri框架构建,后端为FastAPI,提供97个API端点,持久化状态存储在SQLite中。AI管线由四大开源组件驱动:WhisperX负责转录,Demucs进行人声分离,OmniVoice(来自k2-fsa)实现零样本扩散文本转语音,Pyannote处理说话人分割。启动时自动检测GPU并相应调用CUDA、MPS、ROCm或CPU。
系统要求:最低8GB RAM、4GB VRAM(不足时TTS自动卸载至CPU)、10GB磁盘空间。推荐16GB+ RAM、8GB+ VRAM(如NVIDIA RTX 3060+)。无需GPU也可运行,但TTS合成速度约慢3倍。Apple Silicon Mac是无需GPU用户的最佳选择,应用会自动利用MLX优化的Whisper和TTS后端。
安装指南:
- macOS:需安装Python 3.11+、Bun、Xcode Command Line Tools及FFmpeg。克隆仓库后执行
bun install和bun run desktop-prod。首次启动会下载约2.4GB的模型权重。预构建DMG用户若遇到Gatekeeper警告,可通过xattr -cr命令解除隔离。 - Windows:需Windows 10 21H2+或Windows 11、Python 3.11+、Microsoft C++ Build Tools、Bun及FFmpeg。同样克隆并运行
bun run desktop-prod。若首次TTS合成时出现显存不足(OOM),可在设置中禁用torch.compile或设置环境变量TORCH_COMPILE_DISABLE=1。 - Linux(Debian/Ubuntu):安装Python、Bun、FFmpeg及GTK/WebKit依赖。Fedora用户需安装相应包。克隆后运行相同命令。预构建AppImage可能出现白屏问题,设置
WEBKIT_DISABLE_COMPOSITING_MODE=1可解决。Docker用户可仅运行后端API。
Hugging Face令牌:对于说话人分割和大型语音设计引擎,需免费注册Hugging Face并获取读取令牌。可通过应用内设置或环境变量HF_TOKEN配置。还需在Hugging Face模型页面接受pyannote/speaker-diarization-3.1的使用条款。
语音克隆:核心功能,由k2-fsa的OmniVoice模型驱动。无需微调,只需提供3-10秒清晰参考音频。在“Voice Clone”选项卡中,可录制或上传音频,模型即时适应说话人声音。