AI News HubLIVE
站內改寫2 分鐘閱讀

阿里通義實驗室釋出Qwen-Audio-3.0-TTS:支援16種語言的Flash和Plus兩檔託管文本轉語音模型

阿里通義實驗室推出Qwen-Audio-3.0-TTS,一款面向生產的文本轉語音系統,提供Flash(即時互動)和Plus(高質量生成)兩檔,透過阿里雲模型託管服務交付。該模型覆蓋16種語言和20種中文方言,支援自然語言風格控制和86種細粒度內聯標籤,並在Artificial Analysis語音競技場中排名第一。文章詳細介紹了模型架構、效能表現、開發者反饋及定價資訊。

來源MarkTechPost作者: Asif Razzaq

阿里通義實驗室近日釋出了Qwen-Audio-3.0-TTS,一個面向生產環境的文本轉語音(TTS)系統。該模型提供兩個變體:Flash針對即時互動最佳化,首包延遲控制在300毫秒級別;Plus則追求高質量生成,更注重自然度和音色保真度。兩個模型均為託管服務,透過阿里雲模型工作室以API形式提供,而非可下載的權重檔案。

此次釋出重點解決了開發者在生產中遇到的四個關鍵問題:更廣泛的語言覆蓋、自然語言風格控制、細粒度標籤控制,以及參考音訊不乾淨時的魯棒性。Qwen-Audio-3.0-TTS-Plus還在獨立的Artificial Analysis文本轉語音排行榜上位列第一。

模型架構方面,研發團隊採用了12.5Hz低幀率語音分詞器,降低自迴歸解碼成本的同時保留內容和說話人資訊。五階段漸進式訓練正規化協調了語言模型和流匹配元件,包括獨立預訓練、高質量資料退火聯合訓練、強化學習等步驟,顯著提升了內容一致性、韻律自然度、語音保真度等指標。模型還支援長達3分鐘的單次長文本合成、困難的文本歸一化案例以及48kHz輸出的聲碼器超解析度。

多語言能力覆蓋16種語言:阿拉伯語、中文、英語、法語、德語、印尼語、義大利語、日語、韓語、馬來語、葡萄牙語、俄語、西班牙語、他加祿語、泰語和越南語,其中7種為新增加的語言。同時支援20種中文方言區域。在多語言可懂度上,該系列在16種語言中的10種取得最佳詞/字元錯誤率(WER/CER),Flash平均WER/CER為3.87,Plus為3.96。說話人相似度方面,Plus以平均82.75分在所有16種語言中排名第一,Flash為80.44。

為了精細控制,研發團隊在目標文本中嵌入了86種細粒度內聯標籤,用於短語和詞彙級別的區域性控制,覆蓋表達性過渡和非語言事件如笑聲、呼吸、咳嗽和嘆息。控制標籤如[excited]、[sad]設定情感或風格,豐富語言標籤如[laughing]、[gasp]插入單次聲效而不改變周圍語調。需要注意的是,這些情感和豐富語言標籤僅在單向流模式下支援。

在Artificial Analysis語音競技場中,Qwen-Audio-3.0-TTS-Plus以約1236的Elo分數佔據最高質量位置,略高於Simba 3.2的1234,領先Gemini 3.1 Flash TTS(1214)和Sonic 3.5(1207)。但需要指出的是,與Simba 3.2的差距在置信區間內重疊,因此屬於統計上的並列領先。吞吐量方面,Plus每秒約生成16個字元,低於Simba 3.2的30.2等對手。定價為每百萬字元27.59美元,約為ElevenLabs和MiniMax同類服務的三分之一。

開發者社群反應謹慎樂觀。最受關注的是,一款非西方的TTS模型以遠低於現有供應商的價格登頂競技場。常見的保留意見包括模型僅提供託管服務、吞吐量落後於競爭對手,以及命名與開源Qwen3-TTS系列重疊。

值得注意的是,Qwen-Audio-3.0-TTS與開源權重版本Qwen3-TTS(Apache-2.0許可)是不同的產品線,3.0版本僅透過阿里雲模型工作室的API使用。