AI News HubLIVE
站内改写2 分钟阅读

微调Qwen3-TTS实现高质量语音克隆

本文介绍如何微调Qwen3-TTS实现高质量语音克隆,对比ICL、仅说话人嵌入和微调三种方式,并给出完整训练流程。基于约1.5小时LJ Speech数据在单张H100上训练约1小时,微调模型TTFA约130ms,比ICL快约16%,并省去推理时的参考音频处理。

构建富有表现力的语音体验需要捕捉人类语音中的习惯和细微差别,而这要求更丰富、更广泛的数据集。Qwen3-TTS本身已经具备出色的零样本语音克隆能力,仅凭几秒音频就能克隆音色。但若要实现更丰富的克隆效果,就需要在更大规模的句级示例语料上进行微调。

闭源服务商通常将这种能力称为“专业语音克隆”,以区别于“即时语音克隆”。它需要更前置的数据整理步骤,包括寻找合适的配音演员并录制大量语料。作者在Baseten的开源ml-cookbook中发布了一份修改版的Qwen3-TTS官方训练配方,可以在Baseten Training上创建单说话人微调检查点,并方便地部署到Baseten Cloud。

文章对比了三种语音克隆方式。ICL模式将参考音频和参考文本作为前缀加入每次请求,在推理时学习音频与文本的关系,音色条件更强,但需要约数百token的prefill开销,且可能因注意力机制的非确定性导致音色不一致。仅说话人嵌入模式通过ECAPA-TDNN生成约10个token的嵌入,TTFA更低、并发能力更强,但音色还原度因嵌入维度降低而稍逊。微调的核心目标是在不引入ICL额外开销的情况下,学习更丰富的文本-音频对齐关系。具体做法是通过有监督微调训练大量文本-音频配对,并让模型基于一批样本累计的说话人嵌入进行生成,最终将音色信息写入模型权重。

数据集构建方面,作者使用ASR模型对长音频进行转写,并同时生成字符级时间戳,再根据时间戳在结束标点处切分音频和文本,得到句级训练对。示例使用LJ Speech数据集,其中包含约24小时单说话人音频,但作者只用其中约1.5小时(800个片段)进行微调,以模拟真实产品中数据受限的场景。

训练细节上,Qwen3-TTS采用多码本RVQ表示音频特征,每秒12帧、每帧16个码本。训练损失为交叉熵,分为talker loss(第一码本,承载大部分语音学和韵律信息)和sub-talker loss(其余15个码本,捕捉更细粒度的声学细节),权重默认为0.3。为获得更稳定的说话人目标,作者计算64个训练片段经冻结说话人编码器后的嵌入质心,而不是使用单个参考片段。单个片段的嵌入相互之间余弦相似度约0.7,而与质心的相似度达0.85以上,因此质心嵌入更可靠。训练还加入了线性warmup和余弦学习率衰减,因为TTS微调对学习率敏感,过高的学习率会损害音色质量,而平缓的调度既能避免早期过冲,也能防止后期过拟合。

实验结果显示,微调运行在单张H100上约1小时,完成8个epoch。微调模型的TTFA约为130ms,与仅说话人嵌入模式持平,比ICL的约154ms快约16%。不过,在1.5小时数据上,微调并未在相似度或MOS风格质量上明显胜过零样本。其优势主要体现在操作层面(无需参考音频、扩展时延迟稳定)和感知层面(在零样本克隆显得平淡的提示上更具表现力)。随着数据集增长到几小时以上,微调带来的提升会更为显著。

未来方向包括将DPO、GRPO等强化学习奖励信号引入后训练,以及使用EmergentTTS、TTSDSv2等自动评估指标来替代昂贵的人工评估。发音和情感的更精细控制也是重要研究方向,这些通常属于闭源API功能,如何将类似能力微调进开源模型值得探索。