跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

Gradium推出语音设计:输入提示词,几秒内生成全新合成语音

文章摘要

巴黎AI语音公司Gradium发布Voice Design,用户只需用文字描述声音特征,即可在数秒内生成新的合成语音,无需参考音频或采集授权。该功能已免费开放于API与Studio,支持五种语言。盲测中,其准确匹配率领先ElevenLabs等竞品。

来源MarkTechPost作者: Michal Sutter
Gradium推出语音设计:输入提示词,几秒内生成全新合成语音
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

语音智能团队常遇这样的难题:内置目录有400种声音,但需求偏偏要目录之外的那一款——蒙特利尔车行想要魁北克口音前台,讲座需要六十多岁有权威感的男声。需求总比目录丰富,传统做法靠声音克隆一个个补缺口,但每次都要解决声音来源、授权和许可问题。

从Kyutai研究实验室分拆出来的巴黎公司Gradium给出了另一种方案:Voice Design。只需输入一段书面描述,系统在数秒内返回完整的新声音,不需要参考音频,不需要真人声音,也不需要清理使用权。该功能已经上线Gradium API和Studio,所有套餐(包括免费版)均可使用。保留下来的声音与目录声音一样,走同一个流式TTS端点,延迟和输出格式相同。

描述是唯一输入。官方文档列出了模型回应的属性,读起来像选角要求:性别、年龄段、口音或籍贯、音高、语速、能量、音色与共鸣、语气与风格,以及声音所承担的工作。描述支持英、法、西、葡、德五种语言,长度为1至500字符。官方建议在描述末尾说明使用场景,因为它影响的不只是音色,还有语速和语气。一次请求可返回1到5个候选,通常3至5秒生成。候选是同一角色的变体,想要不同角色需要重写描述,而不是要求更多样本。

从候选到正式语音只需四步调用:先用POST /voice-generator/generate创建候选ID,此时ready为false;再通过GET /voice-generator/embeddings轮询状态直到就绪;每个候选可像普通语音一样用候选ID作为voice_id,通过常规TTS接口试听;最后用POST /voices/from-embedding把选中的候选转成正式语音。

候选声音有三项限制:试听文本最多100字符、仅支持REST接口、不能用于TTS WebSocket和语音转语音。未转换的候选会在30天后删除。转换为正式语音免费,且会清除过期时间,占用一个与克隆共享的自定义语音槽。免费版可保存5个,付费版可保存1000个。采样刻意设计为非确定性——Gradium团队会先扩展用户描述,而每次扩展结果不同,因此即便用相同提示词和固定随机种子,也会得到不同声音。

Gradium做了一次盲测:在可通过公共API访问的六个语音设计系统中,用口音提示词进行配对试听,请母语者判断哪段音频更贴近描述,也可以选择平局。七种语言共7,627次比较中,Gradium报告其胜率为72.6%,比ElevenLabs的eleven_ttv_v3高出13.6个百分点——后者为59.0%,Inworld为44.8%,Fish Audio为36.7%,MiniMax为31.7%(胜率按获胜加平局一半计算,50%为基准)。Gradium在全部五种语言中均排第一,领先最大的是多数目录会抹平的地域口音:魁北克法语97%、里奥普拉滕斯西班牙语86%、巴伐利亚德语85%、哥伦比亚西班牙语和非洲葡萄牙语83%。同一组提示词由模型裁判Gemini 3.1 Pro按1到5分打分,结果排序一致:Gradium 4.06、ElevenLabs 3.86、Inworld 3.64、Fish Audio 3.51。另外,产品页面称其在InstructTTSEval英语子集上的提示词遵循度为83.4%。(注:以上数字均由厂商自行设计和执行。)

展开要点与分析

文章情报

工程师进阶

要点

  • Voice Design将最多500字符的声音描述转化为1至5个全新候选语音,生成约3-5秒,无需参考音频。
  • 该功能已在Gradium API和Studio中免费上线,覆盖英语、法语、西班牙语、葡萄牙语和德语。
  • 在7,627次盲听对比中,Gradium语音设计以72.6%的胜率领跑,ElevenLabs为59.0%。
  • 转换后的语音可像目录语音一样通过REST、WebSocket和Speech-to-Speech使用;未转换候选项30天后删除。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。