AI News HubLIVE
站内改写1 分钟阅读

Resemble AI 推出 DramaBox:将场景描述转化为语音表演的开源 TTS 模型

DramaBox 是一款开源的文本转语音模型,用户只需描述场景,模型即可生成带有情感和节奏的语音表演。每个输出都嵌入了水印以验证来源,适用于创意叙事、内容制作等领域。目前仅支持英文。

来源Product Hunt AI作者: Tedi P

Resemble AI 是一家专注于生成式人工智能安全的企业,近日在 Product Hunt 上发布了其第八个产品——DramaBox。这是一款创新的开源文本转语音(TTS)模型,能够根据用户提供的场景描述生成富有表现力的语音表演。与传统的 TTS 模型不同,DramaBox 不需要情感标签或后期处理,用户只需用自然语言描述一个场景,例如“一名脱口秀主持人假装震惊,倒吸一口气,然后爆发出笑声”,模型便会自动理解并生成带有相应语气、笑声、呼吸和节奏的音频。输出为 48kHz 立体声广播级质量的单一音频文件,可直接用于制作。

DramaBox 的每段输出都默认嵌入了 Resemble Watermarker 生成的不可见水印,用于验证音频的来源和真实性。这在生成式 AI 日益被恶意使用的背景下尤为重要,为开发者提供了可信度保障。该模型目前仅支持英文,并已在 GitHub、Hugging Face 以及 Resemble 账户中开放使用。用户可以选择提供一个参考声音进行克隆,或让模型自动选择适合场景的声音。Resemble AI 还建议开发者结合其检测 API 使用,以进一步保障内容安全。

DramaBox 的发布标志着 TTS 技术从简单的文本朗读向场景化表演的转变,为故事创作者、内容生产者以及 AI 研究人员提供了新的工具。Resemble AI 此前曾推出 Chatterbox Turbo、Speech-to-Speech 等多款产品,持续推动生成式 AI 的安全与创新。这款模型的开源性质也鼓励社区贡献和改进,有望加速语音 AI 的发展。未来,Resemble AI 计划拓展多语言支持,并进一步优化水印技术的鲁棒性,以应对深度伪造的挑战。对于开发者和内容创作者来说,DramaBox 不仅是一个强大的创作工具,更是一个可验证的、安全的语音生成解决方案。