語音智能團隊常遇這樣的難題:內置目錄有400種聲音,但需求偏偏要目錄之外的那一款——蒙特利爾車行想要魁北克口音前台,講座需要六十多歲有權威感的男聲。需求總比目錄豐富,傳統做法靠聲音克隆一個個補缺口,但每次都要解決聲音來源、授權和許可問題。
從Kyutai研究實驗室分拆出來的巴黎公司Gradium給出了另一種方案:Voice Design。只需輸入一段書面描述,系統在數秒內返回完整的新聲音,不需要參考音頻,不需要真人聲音,也不需要清理使用權。該功能已經上線Gradium API和Studio,所有套餐(包括免費版)均可使用。保留下來的聲音與目錄聲音一樣,走同一個流式TTS端點,延遲和輸出格式相同。
描述是唯一輸入。官方文檔列出了模型回應的屬性,讀起來像選角要求:性別、年齡段、口音或籍貫、音高、語速、能量、音色與共鳴、語氣與風格,以及聲音所承擔的工作。描述支持英、法、西、葡、德五種語言,長度為1至500字符。官方建議在描述末尾説明使用場景,因為它影響的不只是音色,還有語速和語氣。一次請求可返回1到5個候選,通常3至5秒生成。候選是同一角色的變體,想要不同角色需要重寫描述,而不是要求更多樣本。
從候選到正式語音只需四步調用:先用POST /voice-generator/generate創建候選ID,此時ready為false;再通過GET /voice-generator/embeddings輪詢狀態直到就緒;每個候選可像普通語音一樣用候選ID作為voice_id,通過常規TTS接口試聽;最後用POST /voices/from-embedding把選中的候選轉成正式語音。
候選聲音有三項限制:試聽文本最多100字符、僅支持REST接口、不能用於TTS WebSocket和語音轉語音。未轉換的候選會在30天后刪除。轉換為正式語音免費,且會清除過期時間,佔用一個與克隆共享的自定義語音槽。免費版可保存5個,付費版可保存1000個。採樣刻意設計為非確定性——Gradium團隊會先擴展用户描述,而每次擴展結果不同,因此即便用相同提示詞和固定隨機種子,也會得到不同聲音。
Gradium做了一次盲測:在可通過公共API訪問的六個語音設計系統中,用口音提示詞進行配對試聽,請母語者判斷哪段音頻更貼近描述,也可以選擇平局。七種語言共7,627次比較中,Gradium報告其勝率為72.6%,比ElevenLabs的eleven_ttv_v3高出13.6個百分點——後者為59.0%,Inworld為44.8%,Fish Audio為36.7%,MiniMax為31.7%(勝率按獲勝加平局一半計算,50%為基準)。Gradium在全部五種語言中均排第一,領先最大的是多數目錄會抹平的地域口音:魁北克法語97%、里奧普拉滕斯西班牙語86%、巴伐利亞德語85%、哥倫比亞西班牙語和非洲葡萄牙語83%。同一組提示詞由模型裁判Gemini 3.1 Pro按1到5分打分,結果排序一致:Gradium 4.06、ElevenLabs 3.86、Inworld 3.64、Fish Audio 3.51。另外,產品頁面稱其在InstructTTSEval英語子集上的提示詞遵循度為83.4%。(注:以上數字均由廠商自行設計和執行。)