AI News HubLIVE
サイト内リライト1 分で読了

FineServe: グローバルLLMサービングワークロードの細粒度データセットと特性評価

大規模言語モデル(LLM)の常時オンラインサービス化に伴い、効率的なLLMサービングが重要な課題となっています。既存研究はプロキシトレースや粗粒度の特性評価に依存し、マルチモデルプラットフォームの多様性を捉えきれていません。FineServeは、グローバルな商業マーケットプレイスから収集した実環境のマルチモデルLLMサービングワークロードデータセットであり、異種モデルやタスクにわたる細粒度の特性評価を可能にします。到着ダイナミクスとトークン行動の分析により、モデルアーキテクチャ、規模、タスク意図に応じた変動パターンを明らかにし、構成可能なワークロード生成器を開発しました。

ソースarXiv AI著者: Tiancheng Zhang, Shaoyuan Huang, Mingyuan Wang, Yunfeng Zhao, Xiaofei Wang, Wenyu Wang

大規模言語モデル(LLM)が常時オンラインサービスとして展開されるに伴い、効率的なLLMサービングはシステム分野の重要な課題となっています。既存の研究では、プロキシトレースや粗粒度の特性評価に依存することが多く、マルチモデルプラットフォームにおける異種性を捉えることができていませんでした。この問題に対処するため、Tiancheng Zhangら5名の研究者による論文「FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads」では、新しいデータセットFineServeを提案しています。FineServeは、グローバルな商業マーケットプレイスから収集された、実環境のマルチモデルLLMサービングワークロードデータセットであり、多様なモデルアーキテクチャ、規模、タスク意図にわたる細粒度の特徴を提供します。到着ダイナミクスとトークン行動の分析により、モデルごとに根本的に異なる変動パターンが明らかになりました。例えば、一部のモデルはバースト的に到着する一方、他のモデルは周期的な変動を示します。また、タスクの種類(チャット、翻訳、コード生成など)によってトークン消費量も異なります。これらの知見に基づき、研究チームはFineServeワークロード生成器を開発しました。この生成器は、モデル認識の細粒度ワークロードを構成可能な混合負荷に合成し、マルチモデルサービングプラットフォームのベンチマークに適しています。FineServeは、ルーティング、スケジューリング、容量計画戦略の評価に現実的な基盤を提供し、LLMサービングシステムの最適化に貢献します。論文は14ページ、14の図表からなり、データ収集手法、分析結果、生成器の設計が詳述されています。データセットとコードはGitHubで公開されています。