AI News HubLIVE
サイト内リライト2 分で読了

精度とコストを超えて:動的ワークロード向けレイテンシ対応LLMクエリルーティング

現代の言語クエリルーターは生成レイテンシを無視し、応答品質とコストのみに焦点を当てることが多い。本論文では、自己回帰トークンバッチ処理をシミュレートする軽量なレイテンシ推定器を設計し、最初のトークン生成時間(TTFT)を予測、それをルーティングに組み込むことでレイテンシ、精度、コストを共同最適化する。実験では、標準的な負荷分散と同等のレイテンシを維持しつつ、精度-コスト効用を最大40%向上させる。

ソースarXiv AI著者: Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi

2026年5月13日、Shivam Patelを含む4名の著者による論文「Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads」がarXiv(ID: 2607.18253)に提出されました。この論文は、大規模言語モデル(LLM)の推論効率におけるクエリルーティングの重要な問題に取り組んでいます。現在のクエリルーターは主に応答品質と金銭的コストのバランスを取るためにモデルを選択しますが、生成レイテンシをほとんど無視しています。実際のシステムでは、レイテンシはラウンドロビンや最短キューなどの負荷分散ポリシーで制御され、モデルの精度や推論コストは考慮されません。

研究チームは、クエリレイテンシをルーティングに組み込むことの難しさを指摘します。レイテンシはクエリのプロンプト長だけでなく、モデルインスタンスの現在のプリフィルおよびデコードワークロード、サービングフレームワークのスケジューリングとバッチ処理ポリシーに依存します。そこで彼らは、サービングフレームワーク内の自己回帰トークンのバッチ処理をシミュレートする軽量なレイテンシ推定器を設計し、クエリの最初のトークン生成時間(TTFT)を推定します。

この推定器を組み込んだレイテンシ対応ルーターは、クエリをモデルインスタンスに割り当てる際に、レイテンシ、精度、コストを共同最適化します。実験結果によると、標準的な負荷分散手法と同等のレイテンシを維持しながら、精度-コスト効用を最大40%向上させることができました。これは、応答速度を犠牲にすることなく、回答品質の向上や推論コストの削減が可能であることを示しています。

本研究は、動的ワークロードにおけるLLM推論の効率化に新たな可能性を開きます。LLMのサービス提供が普及するにつれて、レイテンシ対応のルーティング戦略は、特にチャットボットなどのインタラクティブアプリケーションやコスト重視のクラウドコンピューティングシナリオにおいて、次世代推論システムの標準コンポーネントとなる可能性があります。今後の研究では、マルチモーダルモデルへの拡張やテールレイテンシの最適化などが期待されます。