阿里通义实验室发布Qwen-Audio-3.0-TTS:支持16种语言的Flash和Plus两档托管文本转语音模型
阿里通义实验室推出Qwen-Audio-3.0-TTS,一款面向生产的文本转语音系统,提供Flash(实时交互)和Plus(高质量生成)两档,通过阿里云模型托管服务交付。该模型覆盖16种语言和20种中文方言,支持自然语言风格控制和86种细粒度内联标签,并在Artificial Analysis语音竞技场中排名第一。文章详细介绍了模型架构、性能表现、开发者反馈及定价信息。
阿里通义实验室近日发布了Qwen-Audio-3.0-TTS,一个面向生产环境的文本转语音(TTS)系统。该模型提供两个变体:Flash针对实时交互优化,首包延迟控制在300毫秒级别;Plus则追求高质量生成,更注重自然度和音色保真度。两个模型均为托管服务,通过阿里云模型工作室以API形式提供,而非可下载的权重文件。
此次发布重点解决了开发者在生产中遇到的四个关键问题:更广泛的语言覆盖、自然语言风格控制、细粒度标签控制,以及参考音频不干净时的鲁棒性。Qwen-Audio-3.0-TTS-Plus还在独立的Artificial Analysis文本转语音排行榜上位列第一。
模型架构方面,研发团队采用了12.5Hz低帧率语音分词器,降低自回归解码成本的同时保留内容和说话人信息。五阶段渐进式训练范式协调了语言模型和流匹配组件,包括独立预训练、高质量数据退火联合训练、强化学习等步骤,显著提升了内容一致性、韵律自然度、语音保真度等指标。模型还支持长达3分钟的单次长文本合成、困难的文本归一化案例以及48kHz输出的声码器超分辨率。
多语言能力覆盖16种语言:阿拉伯语、中文、英语、法语、德语、印尼语、意大利语、日语、韩语、马来语、葡萄牙语、俄语、西班牙语、他加禄语、泰语和越南语,其中7种为新增加的语言。同时支持20种中文方言区域。在多语言可懂度上,该系列在16种语言中的10种取得最佳词/字符错误率(WER/CER),Flash平均WER/CER为3.87,Plus为3.96。说话人相似度方面,Plus以平均82.75分在所有16种语言中排名第一,Flash为80.44。
为了精细控制,研发团队在目标文本中嵌入了86种细粒度内联标签,用于短语和词汇级别的局部控制,覆盖表达性过渡和非语言事件如笑声、呼吸、咳嗽和叹息。控制标签如[excited]、[sad]设置情感或风格,丰富语言标签如[laughing]、[gasp]插入单次声效而不改变周围语调。需要注意的是,这些情感和丰富语言标签仅在单向流模式下支持。
在Artificial Analysis语音竞技场中,Qwen-Audio-3.0-TTS-Plus以约1236的Elo分数占据最高质量位置,略高于Simba 3.2的1234,领先Gemini 3.1 Flash TTS(1214)和Sonic 3.5(1207)。但需要指出的是,与Simba 3.2的差距在置信区间内重叠,因此属于统计上的并列领先。吞吐量方面,Plus每秒约生成16个字符,低于Simba 3.2的30.2等对手。定价为每百万字符27.59美元,约为ElevenLabs和MiniMax同类服务的三分之一。
开发者社区反应谨慎乐观。最受关注的是,一款非西方的TTS模型以远低于现有供应商的价格登顶竞技场。常见的保留意见包括模型仅提供托管服务、吞吐量落后于竞争对手,以及命名与开源Qwen3-TTS系列重叠。
值得注意的是,Qwen-Audio-3.0-TTS与开源权重版本Qwen3-TTS(Apache-2.0许可)是不同的产品线,3.0版本仅通过阿里云模型工作室的API使用。