Modal 本周正式推出 Auto Endpoints,该服务在保持基础设施可扩展性与鲁棒性的同时,提供了业界领先的推理性能。其核心技术是推测解码,特别适用于延迟敏感的应用场景。
推理延迟主要由四部分构成:客户端与服务器之间的通信延迟、主机与通信开销、预填充延迟以及解码延迟。其中,解码阶段往往是最大的瓶颈,因为每个解码步骤都需要一次完整的前向传播,从 GPU 显存加载模型权重到 SM SRAM。针对这些延迟来源,Modal 团队采用了系统化的优化策略:使用 Modal 服务器缩短通信距离,采用低开销的推理引擎(如 SGLang),利用 FA4 等高效内核加速预填充,以及通过推测解码加速解码阶段。
推测解码的核心思想是让一个快速的推测模型生成多个候选令牌,然后由目标模型并行验证。尽管有时会浪费计算资源,但由于 GPU 在未使用推测解码时并未充分利用算术带宽,这种方法仍能带来显著加速。加速效果与接受长度(平均每次接受的推测令牌数)成正比。
为了最大化接受长度,关键在于为特定应用定制推测模型。Modal 与 Decagon 合作,针对其语音 AI 代理产品进行了优化。Decagon 的语音系统需要将自然语言指令精确映射为系统操作,同时要求极低的端到端延迟。通过综合运用上述优化,Modal 将推理延迟从约 290 毫秒(p50)降至约 190 毫秒,比最好的专有推理提供商还快 60 毫秒以上。
其中最大的收益来自采用定制推测模型。Modal 团队采用了 Z Lab 的 DFlash 技术,该技术利用目标模型的键值投影减少计算冗余,并支持并行生成推测令牌。与 Z Lab 和 SGLang 合作,他们发布了高性能开源实现和预训练推测模型,例如针对 Qwen 3.5 397B-A17B 的推测器比多令牌预测(MTP)提升超过 50%。
此外,Modal 采用“中间训练”方法:使用任务特定的合成数据微调通用推测模型,避免直接使用用户敏感数据,同时有效提升目标任务性能。例如,对于结构化输出任务,可通过填充合理内容生成大量合成数据来训练推测器。还需监控过拟合,确保模型能泛化到生产环境。
总之,通过系统优化各延迟环节,特别是利用先进的推测解码技术,Modal 实现了超越专有提供商的推理性能,为 AI 代理等延迟敏感应用提供了有力支撑。