本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

投機的デコードで最先端の推論レイテンシを実現

記事の要約

ModalとDecagonは、投機的デコードを用いて推論レイテンシを100ミリ秒削減し、専用プロバイダを上回りました。本記事では、通信遅延、ホストオーバーヘッド、プリフィル遅延、デコード遅延の最適化を含む低レイテンシのプレイブックを詳述し、特にカスタム投機的デコードモデル(DFlash)による大きな成果に焦点を当てています。

ソースModal Blog
投機的デコードで最先端の推論レイテンシを実現
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Modal は今週、Modal Auto Endpoints を発表しました。このサービスは、インフラのスケーラビリティとロバスト性を維持しながら、最先端の推論性能を提供します。中核技術は投機的デコードであり、特にレイテンシに敏感なアプリケーションに適しています。

推論レイテンシは主に、クライアント-サーバ間通信遅延、ホスト/通信オーバーヘッド、プリフィル遅延、およびデコード遅延から構成されます。デコードフェーズが通常主要なボトルネックであり、複数回の反復が必要です。Modal チームは、Modal サーバによる通信距離短縮、低オーバーヘッドの推論エンジン、FA4 などの効率的カーネル、投機的デコードを適用しました。

投機的デコードでは、高速な投機モデルが複数の候補トークンを生成し、ターゲットモデルが並列検証します。GPU の演算帯域幅は未使用時には十分活用されていないため、この手法は顕著な高速化をもたらします。高速化は受入長に比例します。

受入長を最大化するには、特定アプリケーション向けに投機モデルをカスタマイズすることが重要です。Modal は Decagon と協力し、音声 AI エージェント製品を最適化しました。Decagon の音声システムは自然言語指示を正確にマッピングし、かつ低レイテンシが要求されます。これにより、推論レイテンシを約 290 ms から約 190 ms に削減し、専用プロバイダを 60 ms 以上上回りました。

最大の効果はカスタム投機モデルによるものです。Modal は Z Lab の DFlash 技術を採用し、ターゲットモデルの KV 投影を利用して計算冗長性を削減し、並列生成を実現しました。Z Lab や SGLang と協力し、Qwen 3.5 397B-A17B 向け投機器は MTP 比 50% 以上の向上を達成しました。

さらに、「中間訓練」として、タスク固有の合成データで汎用投機モデルを微調整します。ユーザデータを公開せずに性能を向上できます。例えば、構造化出力タスクでは、適切な内容を埋めて合成データを生成します。過学習に注意し、追加データで分布外性能を監視します。

これらの手法により、Modal は専用プロバイダを凌ぐ推論性能を実現し、AI エージェントなどのレイテンシ敏感なアプリケーションを強力に支援します。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • Modal Auto Endpointsは、Blackwell GPU、SGLangエンジン、Modalサーバを活用した投機的デコードにより低レイテンシを実現。
  • 投機的デコードはトークン生成を並列化してデコード遅延を削減し、効率は受入長に依存。
  • カスタム投機的モデル(特にDFlash)は受入長を劇的に向上させ、エンドツーエンドのレイテンシを削減。
  • 合成データによる投機的モデルのファインチューニングは、ユーザデータを公開せずにタスク特化の最適化を可能にする。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。