LLM服務的一年:工作負載演變、緩存與負載均衡
這項arXiv研究提供了來自Chutes的為期一年的LLM服務生產軌跡,覆蓋了多個模型和用户的完整生產行為。研究從聚合、時間、模型和用户四個視角揭示了通常被聚合視圖隱藏的工作負載演變和用户-模型結構,並計劃隨論文發佈完整軌跡。
大型語言模型(LLM)服務已成為現代雲計算中的關鍵工作負載。從交互式聊天到批量推理,LLM 應用對延遲、吞吐量和成本都提出了極高的要求,因此服務系統的設計和優化至關重要。要驗證一個調度算法、緩存策略或負載均衡機制的效果,僅靠合成流量或短期採樣是遠遠不夠的,真實的生產軌跡才是最有説服力的依據。然而,現有的 LLM 服務工作負載研究在規模與範圍上存在明顯侷限:它們往往只覆蓋數天或數週的時間窗口,難以反映負載隨時間的動態演化;同時,由於缺乏細粒度的用户行為數據,這些研究也難以揭示用户與模型之間真實而複雜的交互模式。這樣一來,研究者很難回答諸如“熱門模型與長尾模型對資源的需求有何不同”“用户請求的到達模式在一天之內如何變化”“緩存策略在真實負載下能帶來多大的收益”等關鍵問題。
為了填補這一空白,本文作者對 Chutes 平台過去一年的生產軌跡進行了系統性的特徵分析和縱向研究。與以往工作相比,這份軌跡的獨特之處在於其完整性和多樣性:它涵蓋了數百個模型和大量真實用户的全部生產請求,既包括訪問量最高的熱門模型,也包括使用稀疏的長尾模型。研究者從四個層面切入:聚合層面展示了整體流量規模和趨勢;時間層面分析了請求到達率、會話長度等指標在小時、日、周尺度上的變化規律;模型層面比較了不同模型在請求量、上下文長度、生成 token 數等方面的差異;用户層面則刻畫了用户調用模型的行為模式,以及用户與模型之間的二部圖結構。這些分析揭示了許多在聚合視圖中被掩蓋的規律,例如長尾效應對緩存命中率的影響、突發流量與模型切換之間的關聯等。
研究團隊表示,為了支持後續研究,完整的年度軌跡數據將隨論文一併發佈。其他研究者和工程師可以直接基於這些真實數據開展服務系統設計、容量規劃、緩存策略評估、負載均衡算法驗證等工作,而無需依賴採樣或人工合成的工作負載。這項工作的發佈有望成為 LLM 服務系統研究的重要基準。
本論文題為“A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing”,由 William Nixon 與其他四位作者合作完成,並於 2026 年 7 月 3 日提交至 arXiv(編號:2608.13573),主題分類為人工智能(cs.AI)。論文還介紹了作者在緩存與負載均衡方面基於該軌跡的初步觀察,暗示了未來的研究方向。