跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

通过推测解码实现最先进的推理延迟

文章摘要

Modal与Decagon合作,利用推测解码将推理延迟降低100毫秒,超越了专有推理提供商。本文详细介绍了通过优化通信延迟、主机开销、预填充延迟和解码延迟来实现低延迟的完整策略,并重点展示了为特定应用定制推测模型(DFlash技术)如何带来显著性能提升。

通过推测解码实现最先进的推理延迟
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

Modal 本周正式推出 Auto Endpoints,该服务在保持基础设施可扩展性与鲁棒性的同时,提供了业界领先的推理性能。其核心技术是推测解码,特别适用于延迟敏感的应用场景。

推理延迟主要由四部分构成:客户端与服务器之间的通信延迟、主机与通信开销、预填充延迟以及解码延迟。其中,解码阶段往往是最大的瓶颈,因为每个解码步骤都需要一次完整的前向传播,从 GPU 显存加载模型权重到 SM SRAM。针对这些延迟来源,Modal 团队采用了系统化的优化策略:使用 Modal 服务器缩短通信距离,采用低开销的推理引擎(如 SGLang),利用 FA4 等高效内核加速预填充,以及通过推测解码加速解码阶段。

推测解码的核心思想是让一个快速的推测模型生成多个候选令牌,然后由目标模型并行验证。尽管有时会浪费计算资源,但由于 GPU 在未使用推测解码时并未充分利用算术带宽,这种方法仍能带来显著加速。加速效果与接受长度(平均每次接受的推测令牌数)成正比。

为了最大化接受长度,关键在于为特定应用定制推测模型。Modal 与 Decagon 合作,针对其语音 AI 代理产品进行了优化。Decagon 的语音系统需要将自然语言指令精确映射为系统操作,同时要求极低的端到端延迟。通过综合运用上述优化,Modal 将推理延迟从约 290 毫秒(p50)降至约 190 毫秒,比最好的专有推理提供商还快 60 毫秒以上。

其中最大的收益来自采用定制推测模型。Modal 团队采用了 Z Lab 的 DFlash 技术,该技术利用目标模型的键值投影减少计算冗余,并支持并行生成推测令牌。与 Z Lab 和 SGLang 合作,他们发布了高性能开源实现和预训练推测模型,例如针对 Qwen 3.5 397B-A17B 的推测器比多令牌预测(MTP)提升超过 50%。

此外,Modal 采用“中间训练”方法:使用任务特定的合成数据微调通用推测模型,避免直接使用用户敏感数据,同时有效提升目标任务性能。例如,对于结构化输出任务,可通过填充合理内容生成大量合成数据来训练推测器。还需监控过拟合,确保模型能泛化到生产环境。

总之,通过系统优化各延迟环节,特别是利用先进的推测解码技术,Modal 实现了超越专有提供商的推理性能,为 AI 代理等延迟敏感应用提供了有力支撑。

展开要点与分析

文章情报

工程师进阶

要点

  • Modal Auto Endpoints通过推测解码实现低延迟推理,关键优化是使用Blackwell GPU、SGLang引擎和Modal服务器。
  • 推测解码通过并行处理多个推测令牌来减少解码阶段延迟,且效率主要取决于接受长度。
  • 定制推测模型(如基于DFlash技术)可以大幅提升接受长度,从而显著降低端到端延迟。
  • 通过使用合成数据微调通用推测模型,无需暴露用户数据即可适应特定任务。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。