AI News HubLIVE
站內改寫2 分鐘閱讀

LLM服務的一年:工作負載演變、快取與負載均衡

這項arXiv研究提供了來自Chutes的為期一年的LLM服務生產軌跡,覆蓋了多個模型和使用者的完整生產行為。研究從聚合、時間、模型和使用者四個視角揭示了通常被聚合檢視隱藏的工作負載演變和使用者-模型結構,並計劃隨論文釋出完整軌跡。

來源arXiv AI作者: William Nixon, Jon Durbin, Florian Standhartinger, Haryadi S. Gunawi, Juncheng Yang

大型語言模型(LLM)服務已成為現代雲端計算中的關鍵工作負載。從互動式聊天到批次推理,LLM 應用對延遲、吞吐量和成本都提出了極高的要求,因此服務系統的設計和最佳化至關重要。要驗證一個排程演算法、快取策略或負載均衡機制的效果,僅靠合成流量或短期取樣是遠遠不夠的,真實的生產軌跡才是最有說服力的依據。然而,現有的 LLM 服務工作負載研究在規模與範圍上存在明顯侷限:它們往往只覆蓋數天或數週的時間視窗,難以反映負載隨時間的動態演化;同時,由於缺乏細粒度的使用者行為資料,這些研究也難以揭示使用者與模型之間真實而複雜的互動模式。這樣一來,研究者很難回答諸如“熱門模型與長尾模型對資源的需求有何不同”“使用者請求的到達模式在一天之內如何變化”“快取策略在真實負載下能帶來多大的收益”等關鍵問題。

為了填補這一空白,本文作者對 Chutes 平臺過去一年的生產軌跡進行了系統性的特徵分析和縱向研究。與以往工作相比,這份軌跡的獨特之處在於其完整性和多樣性:它涵蓋了數百個模型和大量真實使用者的全部生產請求,既包括訪問量最高的熱門模型,也包括使用稀疏的長尾模型。研究者從四個層面切入:聚合層面展示了整體流量規模和趨勢;時間層面分析了請求到達率、會話長度等指標在小時、日、周尺度上的變化規律;模型層面比較了不同模型在請求量、上下文長度、生成 token 數等方面的差異;使用者層面則刻畫了使用者呼叫模型的行為模式,以及使用者與模型之間的二部圖結構。這些分析揭示了許多在聚合檢視中被掩蓋的規律,例如長尾效應對快取命中率的影響、突發流量與模型切換之間的關聯等。

研究團隊表示,為了支援後續研究,完整的年度軌跡資料將隨論文一併釋出。其他研究者和工程師可以直接基於這些真實資料開展服務系統設計、容量規劃、快取策略評估、負載均衡演算法驗證等工作,而無需依賴取樣或人工合成的工作負載。這項工作的釋出有望成為 LLM 服務系統研究的重要基準。

本論文題為“A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing”,由 William Nixon 與其他四位作者合作完成,並於 2026 年 7 月 3 日提交至 arXiv(編號:2608.13573),主題分類為人工智慧(cs.AI)。論文還介紹了作者在快取與負載均衡方面基於該軌跡的初步觀察,暗示了未來的研究方向。

LLM服務的一年:工作負載演變、快取與負載均衡 | AI News Hub