跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

Gradium推出語音設計:輸入提示詞,幾秒內生成全新合成語音

文章摘要

巴黎AI語音公司Gradium釋出Voice Design,使用者只需用文字描述聲音特徵,即可在數秒內生成新的合成語音,無需參考音訊或採集授權。該功能已免費開放於API與Studio,支援五種語言。盲測中,其準確匹配率領先ElevenLabs等競品。

來源MarkTechPost作者: Michal Sutter
Gradium推出語音設計:輸入提示詞,幾秒內生成全新合成語音
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

語音智慧團隊常遇這樣的難題:內建目錄有400種聲音,但需求偏偏要目錄之外的那一款——蒙特利爾車行想要魁北克口音前臺,講座需要六十多歲有權威感的男聲。需求總比目錄豐富,傳統做法靠聲音克隆一個個補缺口,但每次都要解決聲音來源、授權和許可問題。

從Kyutai研究實驗室分拆出來的巴黎公司Gradium給出了另一種方案:Voice Design。只需輸入一段書面描述,系統在數秒內返回完整的新聲音,不需要參考音訊,不需要真人聲音,也不需要清理使用權。該功能已經上線Gradium API和Studio,所有套餐(包括免費版)均可使用。保留下來的聲音與目錄聲音一樣,走同一個流式TTS端點,延遲和輸出格式相同。

描述是唯一輸入。官方文件列出了模型回應的屬性,讀起來像選角要求:性別、年齡段、口音或籍貫、音高、語速、能量、音色與共鳴、語氣與風格,以及聲音所承擔的工作。描述支援英、法、西、葡、德五種語言,長度為1至500字元。官方建議在描述末尾說明使用場景,因為它影響的不只是音色,還有語速和語氣。一次請求可返回1到5個候選,通常3至5秒生成。候選是同一角色的變體,想要不同角色需要重寫描述,而不是要求更多樣本。

從候選到正式語音只需四步呼叫:先用POST /voice-generator/generate建立候選ID,此時ready為false;再透過GET /voice-generator/embeddings輪詢狀態直到就緒;每個候選可像普通語音一樣用候選ID作為voice_id,透過常規TTS介面試聽;最後用POST /voices/from-embedding把選中的候選轉成正式語音。

候選聲音有三項限制:試聽文本最多100字元、僅支援REST介面、不能用於TTS WebSocket和語音轉語音。未轉換的候選會在30天后刪除。轉換為正式語音免費,且會清除過期時間,佔用一個與克隆共享的自定義語音槽。免費版可儲存5個,付費版可儲存1000個。取樣刻意設計為非確定性——Gradium團隊會先擴充套件使用者描述,而每次擴充套件結果不同,因此即便用相同提示詞和固定隨機種子,也會得到不同聲音。

Gradium做了一次盲測:在可透過公共API訪問的六個語音設計系統中,用口音提示詞進行配對試聽,請母語者判斷哪段音訊更貼近描述,也可以選擇平局。七種語言共7,627次比較中,Gradium報告其勝率為72.6%,比ElevenLabs的eleven_ttv_v3高出13.6個百分點——後者為59.0%,Inworld為44.8%,Fish Audio為36.7%,MiniMax為31.7%(勝率按獲勝加平局一半計算,50%為基準)。Gradium在全部五種語言中均排第一,領先最大的是多數目錄會抹平的地域口音:魁北克法語97%、里奧普拉滕斯西班牙語86%、巴伐利亞德語85%、哥倫比亞西班牙語和非洲葡萄牙語83%。同一組提示詞由模型裁判Gemini 3.1 Pro按1到5分打分,結果排序一致:Gradium 4.06、ElevenLabs 3.86、Inworld 3.64、Fish Audio 3.51。另外,產品頁面稱其在InstructTTSEval英語子集上的提示詞遵循度為83.4%。(注:以上數字均由廠商自行設計和執行。)

展開要點與分析

文章情報

工程師進階

要點

  • Voice Design將最多500字元的聲音描述轉化為1至5個全新候選語音,生成約3-5秒,無需參考音訊。
  • 該功能已在Gradium API和Studio中免費上線,覆蓋英語、法語、西班牙語、葡萄牙語和德語。
  • 在7,627次盲聽對比中,Gradium語音設計以72.6%的勝率領跑,ElevenLabs為59.0%。
  • 轉換後的語音可像目錄語音一樣透過REST、WebSocket和Speech-to-Speech使用;未轉換候選項30天后刪除。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。