Modal は今週、Modal Auto Endpoints を発表しました。このサービスは、インフラのスケーラビリティとロバスト性を維持しながら、最先端の推論性能を提供します。中核技術は投機的デコードであり、特にレイテンシに敏感なアプリケーションに適しています。
推論レイテンシは主に、クライアント-サーバ間通信遅延、ホスト/通信オーバーヘッド、プリフィル遅延、およびデコード遅延から構成されます。デコードフェーズが通常主要なボトルネックであり、複数回の反復が必要です。Modal チームは、Modal サーバによる通信距離短縮、低オーバーヘッドの推論エンジン、FA4 などの効率的カーネル、投機的デコードを適用しました。
投機的デコードでは、高速な投機モデルが複数の候補トークンを生成し、ターゲットモデルが並列検証します。GPU の演算帯域幅は未使用時には十分活用されていないため、この手法は顕著な高速化をもたらします。高速化は受入長に比例します。
受入長を最大化するには、特定アプリケーション向けに投機モデルをカスタマイズすることが重要です。Modal は Decagon と協力し、音声 AI エージェント製品を最適化しました。Decagon の音声システムは自然言語指示を正確にマッピングし、かつ低レイテンシが要求されます。これにより、推論レイテンシを約 290 ms から約 190 ms に削減し、専用プロバイダを 60 ms 以上上回りました。
最大の効果はカスタム投機モデルによるものです。Modal は Z Lab の DFlash 技術を採用し、ターゲットモデルの KV 投影を利用して計算冗長性を削減し、並列生成を実現しました。Z Lab や SGLang と協力し、Qwen 3.5 397B-A17B 向け投機器は MTP 比 50% 以上の向上を達成しました。
さらに、「中間訓練」として、タスク固有の合成データで汎用投機モデルを微調整します。ユーザデータを公開せずに性能を向上できます。例えば、構造化出力タスクでは、適切な内容を埋めて合成データを生成します。過学習に注意し、追加データで分布外性能を監視します。
これらの手法により、Modal は専用プロバイダを凌ぐ推論性能を実現し、AI エージェントなどのレイテンシ敏感なアプリケーションを強力に支援します。