AI News HubLIVE
サイト内リライト2 分で読了

LLMサービスの1年:ワークロードの進化、キャッシング、負荷分散

このarXiv研究は、Chutesの1年間の本番トレースを提示し、多くのモデルとユーザーにわたる完全な本番動作を捉えています。集計、時間、モデル、ユーザーの各視点から、集計ビューの背後に隠れたワークロードの進化とユーザー・モデル構造を明らかにし、完全なトレースを論文とともに公開します。

ソースarXiv AI著者: William Nixon, Jon Durbin, Florian Standhartinger, Haryadi S. Gunawi, Juncheng Yang

大規模言語モデル(LLM)のサービスは、現代のクラウドコンピューティングの中核的なワークロードとなっています。インタラクティブなチャットからバッチ推論まで、LLMアプリケーションはレイテンシ、スループット、コストに高い要求を突きつけるため、サービスシステムの設計と最適化は極めて重要です。スケジューリングアルゴリズム、キャッシュ戦略、負荷分散メカニズムの効果を検証するには、合成トラフィックや短期間のサンプリングだけでは不十分であり、実環境で収集された本番トレースが不可欠です。しかし、既存のLLMサービスワークロード研究は、規模と範囲の点で大きな限界を抱えています。多くの研究は数日から数週間という短い期間だけを観測し、ワークロードの時間的進化を捉えきれていません。また、ユーザーとモデルの相互作用を詳細に記録したデータが不足しているため、両者の複雑な関係がブラックボックスのままになっています。その結果、人気モデルとロングテールモデルでリソース需要がどう異なるのか、ユーザーリクエストの到着パターンが日内でどう変化するのか、実負荷の下でキャッシュ戦略がどの程度の効果を発揮するのかといった重要な問いに、既存研究は十分に答えられていません。

このギャップを埋めるため、著者らはChutesプラットフォームで収集された1年間の本番トレースを、全体像の特徴づけと縦断的研究の両方の観点から分析しました。従来の研究と異なり、このトレースは数百のモデルと多数の実ユーザーによる全リクエストを網羅しており、アクセス数の多い人気モデルから利用頻度の低いロングテールモデルまで含まれています。分析は4つのレベルで行われます。集計レベルでは全体のトラフィック量と傾向を示し、時間レベルではリクエスト到着率やセッション長の時間変動を時間帯・曜日・週単位で調べ、モデルレベルではモデルごとのリクエスト数、コンテキスト長、生成トークン数を比較し、ユーザーレベルではユーザーのモデル呼び出しパターンとユーザー・モデルの二部構造を明らかにします。これにより、集計ビューの背後に隠れていた、キャッシュヒット率に影響するロングテール効果や、バーストトラフィックとモデル切り替えの関連などの規則性が浮き彫りになりました。

研究チームは、今後の研究を支援するため、完全な1年間のトレースを論文とともに公開すると述べています。これにより、他の研究者やエンジニアは、サンプリングや合成生成されたワークロードに頼ることなく、実際の本番動作に基づいてサービスシステムの設計、キャパシティ計画、キャッシュ戦略の評価、負荷分散アルゴリズムの検証などを行うことができます。この取り組みは、LLMサービスシステム研究の新たなベンチマークとなるでしょう。

本論文は「A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing」と題され、William Nixon氏と他の4人の著者によって執筆され、2026年7月3日にarXiv(番号:2608.13573)に提出されました。主題は人工知能(cs.AI)です。

LLMサービスの1年:ワークロードの進化、キャッシング、負荷分散 | AI News Hub