语音智能团队常遇这样的难题:内置目录有400种声音,但需求偏偏要目录之外的那一款——蒙特利尔车行想要魁北克口音前台,讲座需要六十多岁有权威感的男声。需求总比目录丰富,传统做法靠声音克隆一个个补缺口,但每次都要解决声音来源、授权和许可问题。
从Kyutai研究实验室分拆出来的巴黎公司Gradium给出了另一种方案:Voice Design。只需输入一段书面描述,系统在数秒内返回完整的新声音,不需要参考音频,不需要真人声音,也不需要清理使用权。该功能已经上线Gradium API和Studio,所有套餐(包括免费版)均可使用。保留下来的声音与目录声音一样,走同一个流式TTS端点,延迟和输出格式相同。
描述是唯一输入。官方文档列出了模型回应的属性,读起来像选角要求:性别、年龄段、口音或籍贯、音高、语速、能量、音色与共鸣、语气与风格,以及声音所承担的工作。描述支持英、法、西、葡、德五种语言,长度为1至500字符。官方建议在描述末尾说明使用场景,因为它影响的不只是音色,还有语速和语气。一次请求可返回1到5个候选,通常3至5秒生成。候选是同一角色的变体,想要不同角色需要重写描述,而不是要求更多样本。
从候选到正式语音只需四步调用:先用POST /voice-generator/generate创建候选ID,此时ready为false;再通过GET /voice-generator/embeddings轮询状态直到就绪;每个候选可像普通语音一样用候选ID作为voice_id,通过常规TTS接口试听;最后用POST /voices/from-embedding把选中的候选转成正式语音。
候选声音有三项限制:试听文本最多100字符、仅支持REST接口、不能用于TTS WebSocket和语音转语音。未转换的候选会在30天后删除。转换为正式语音免费,且会清除过期时间,占用一个与克隆共享的自定义语音槽。免费版可保存5个,付费版可保存1000个。采样刻意设计为非确定性——Gradium团队会先扩展用户描述,而每次扩展结果不同,因此即便用相同提示词和固定随机种子,也会得到不同声音。
Gradium做了一次盲测:在可通过公共API访问的六个语音设计系统中,用口音提示词进行配对试听,请母语者判断哪段音频更贴近描述,也可以选择平局。七种语言共7,627次比较中,Gradium报告其胜率为72.6%,比ElevenLabs的eleven_ttv_v3高出13.6个百分点——后者为59.0%,Inworld为44.8%,Fish Audio为36.7%,MiniMax为31.7%(胜率按获胜加平局一半计算,50%为基准)。Gradium在全部五种语言中均排第一,领先最大的是多数目录会抹平的地域口音:魁北克法语97%、里奥普拉滕斯西班牙语86%、巴伐利亚德语85%、哥伦比亚西班牙语和非洲葡萄牙语83%。同一组提示词由模型裁判Gemini 3.1 Pro按1到5分打分,结果排序一致:Gradium 4.06、ElevenLabs 3.86、Inworld 3.64、Fish Audio 3.51。另外,产品页面称其在InstructTTSEval英语子集上的提示词遵循度为83.4%。(注:以上数字均由厂商自行设计和执行。)