基于解耦时间深度扩散变换器的内存高效音频合成
Apple 发布了 Siri Expressive Voices,其背后是名为“去分词器”的内存高效音频合成架构。该架构将基础模型发出的语义音频令牌转换为高保真音频,在 Apple Matrix 协处理器(AMX)的严格计算和内存预算内运行。它采用三组件设计:流式编码器、时间解码器和深度解码器,系统性地解耦时间和深度处理。单个可重复使用的深度解码器利用扩散变换器(DiT)风格的阶段条件生成所有 RVQ 层级,取代了先前多解码器架构中专用的逐层解码器。因果滑动窗口注意力与固定窗口键值缓存使内存复杂度与序列长度无关。在 AMX 上部署时,去分词器每个生成步骤约需 10ms(比实时快约 16 倍),峰值运行时内存约 21MB,设备端资产 329MB,可在设备端基础模型旁连续流式合成 20-320 秒的音频。该架构已部署在 Siri Expressive Voices 中,在 AFM 3 Core Advanced(10 亿参数激活规模)下运行,平均意见得分(MOS)比之前的设备端文本转语音系统整体提升 0.28(4.15 vs. 3.87),在对话语音上提升 0.42(4.24 vs. 3.82)。
Apple 最新发布的 Siri Expressive Voices 功能实现了丰富、可配置语音的实时设备端合成,其背后是 Apple 最强大的设备端基础模型 AFM 3 Core Advanced。本文介绍了支撑该能力的内存高效音频合成架构:一种去分词器,它将基础模型生成的语义音频令牌转换为高保真音频,同时满足 Apple Matrix 协处理器(AMX)严格的计算和内存预算要求。
该去分词器将语义音频令牌转换为残差向量量化(RVQ)表示,采用三组件设计:流式编码器、时间解码器和深度解码器。这种设计系统性地将时间处理和深度处理解耦。其中,深度解码器是核心创新——它采用扩散变换器(DiT)风格的阶段条件,能够自回归地生成所有 RVQ 层级,从而取代了传统多解码器架构中每个层级专用的解码器,极大地简化了模型结构。此外,因果滑动窗口注意力结合固定窗口键值缓存机制,使得内存复杂度保持恒定,不随序列长度变化。
在 AMX 上部署时,该去分词器每个生成步骤仅需约 10 毫秒,比实时处理速度快约 16 倍。其峰值运行时内存仅为约 21 MB,设备端资产占用 329 MB,这使得它能够在设备端基础模型旁连续流式合成 20 至 320 秒的音频。这种恒定且小巧的内存占用,彻底改变了传统基于变换器或 GAN 的方法中线性甚至二次增长的内存消耗模式。
全面的消融研究验证了关键架构组件的有效性,包括 DiT 条件机制、时间前瞻处理以及统一深度解码策略。通过音素可辨别性分析、感知质量指标和神经质量估计等音频质量评估,证实了该架构在保持合成保真度的同时,相比现有方法实现了计算效率的提升。
目前,该架构已作为 Siri Expressive Voices 的一部分投入生产,为 Apple 设备中的语速和表现力自定义滑块以及自定义助手语音支持提供动力。它在 AFM 3 Core Advanced 中运行,激活规模为 10 亿参数。与之前的设备端文本转语音系统相比,其平均意见得分(MOS)总体提升 0.28(从 3.87 提升至 4.15),在对话语音场景中提升 0.42(从 3.82 提升至 4.24)。