Resemble AI 推出 DramaBox:將場景描述轉化為語音表演的開源 TTS 模型
DramaBox 是一款開源的文本轉語音模型,用户只需描述場景,模型即可生成帶有情感和節奏的語音表演。每個輸出都嵌入了水印以驗證來源,適用於創意敍事、內容製作等領域。目前僅支持英文。
Resemble AI 是一家專注於生成式人工智能安全的企業,近日在 Product Hunt 上發佈了其第八個產品——DramaBox。這是一款創新的開源文本轉語音(TTS)模型,能夠根據用户提供的場景描述生成富有表現力的語音表演。與傳統的 TTS 模型不同,DramaBox 不需要情感標籤或後期處理,用户只需用自然語言描述一個場景,例如“一名脱口秀主持人假裝震驚,倒吸一口氣,然後爆發出笑聲”,模型便會自動理解並生成帶有相應語氣、笑聲、呼吸和節奏的音頻。輸出為 48kHz 立體聲廣播級質量的單一音頻文件,可直接用於製作。
DramaBox 的每段輸出都默認嵌入了 Resemble Watermarker 生成的不可見水印,用於驗證音頻的來源和真實性。這在生成式 AI 日益被惡意使用的背景下尤為重要,為開發者提供了可信度保障。該模型目前僅支持英文,並已在 GitHub、Hugging Face 以及 Resemble 賬户中開放使用。用户可以選擇提供一個參考聲音進行克隆,或讓模型自動選擇適合場景的聲音。Resemble AI 還建議開發者結合其檢測 API 使用,以進一步保障內容安全。
DramaBox 的發佈標誌着 TTS 技術從簡單的文本朗讀向場景化表演的轉變,為故事創作者、內容生產者以及 AI 研究人員提供了新的工具。Resemble AI 此前曾推出 Chatterbox Turbo、Speech-to-Speech 等多款產品,持續推動生成式 AI 的安全與創新。這款模型的開源性質也鼓勵社區貢獻和改進,有望加速語音 AI 的發展。未來,Resemble AI 計劃拓展多語言支持,並進一步優化水印技術的魯棒性,以應對深度偽造的挑戰。對於開發者和內容創作者來説,DramaBox 不僅是一個強大的創作工具,更是一個可驗證的、安全的語音生成解決方案。