AI News HubLIVE
站內改寫1 分鐘閱讀

FineServe:細粒度的大語言模型服務負載數據集與特徵分析

大語言模型作為在線服務不斷部署,高效服務成為關鍵挑戰。現有研究多依賴代理軌跡或粗粒度特徵,無法捕捉多模型平台的異構性。FineServe從全球商業市場收集多模型服務負載數據,提供細粒度的真實世界動態特徵。通過分析到達動態和令牌行為,揭示了不同模型架構、規模和任務意圖下的波動機制,並開發了負載生成器,用於評估路由、調度和容量規劃策略。

來源arXiv AI作者: Tiancheng Zhang, Shaoyuan Huang, Mingyuan Wang, Yunfeng Zhao, Xiaofei Wang, Wenyu Wang

近年來,大語言模型(LLM)作為在線服務日益普及,如何高效地服務這些模型成為系統領域的熱點問題。當前,針對LLM服務負載的研究通常依賴於代理軌跡或粗粒度的特徵,難以捕獲多模型平台中不同模型架構、規模和任務意圖帶來的異構性。為了填補這一空白,由Tiancheng Zhang等五位研究者完成的論文《FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads》提出了一個全新的數據集FineServe。該數據集從全球商業市場收集了真實的多模型LLM服務負載數據,覆蓋了從輕量級對話模型到大規模生成模型的廣泛範圍,並記錄了請求到達時間、令牌生成行為等細粒度信息。利用FineServe,研究團隊對到達動態和令牌行為進行了全面分析,發現了不同模型在請求到達模式上的顯著差異:某些模型呈現突發性到達,而另一些則表現出週期性波動。此外,令牌消耗的長度和速率也隨任務意圖(如問答、摘要、代碼生成)而變。基於這些洞察,他們開發了FineServe負載生成器,該生成器能夠將模型感知的細粒度負載組合成可配置的混合負載,專門用於多模型服務平台的基準測試。FineServe為評估路由策略、調度算法和容量規劃方案提供了現實基礎,有助於提升LLM服務系統的效率。該論文還包含14頁正文和14張圖表,詳細描述了數據收集方法、分析結果和生成器設計。數據集和代碼已在GitHub上開源,供研究者和工程師使用。