LLM服务的一年:工作负载演变、缓存与负载均衡
这项arXiv研究提供了来自Chutes的为期一年的LLM服务生产轨迹,覆盖了多个模型和用户的完整生产行为。研究从聚合、时间、模型和用户四个视角揭示了通常被聚合视图隐藏的工作负载演变和用户-模型结构,并计划随论文发布完整轨迹。
大型语言模型(LLM)服务已成为现代云计算中的关键工作负载。从交互式聊天到批量推理,LLM 应用对延迟、吞吐量和成本都提出了极高的要求,因此服务系统的设计和优化至关重要。要验证一个调度算法、缓存策略或负载均衡机制的效果,仅靠合成流量或短期采样是远远不够的,真实的生产轨迹才是最有说服力的依据。然而,现有的 LLM 服务工作负载研究在规模与范围上存在明显局限:它们往往只覆盖数天或数周的时间窗口,难以反映负载随时间的动态演化;同时,由于缺乏细粒度的用户行为数据,这些研究也难以揭示用户与模型之间真实而复杂的交互模式。这样一来,研究者很难回答诸如“热门模型与长尾模型对资源的需求有何不同”“用户请求的到达模式在一天之内如何变化”“缓存策略在真实负载下能带来多大的收益”等关键问题。
为了填补这一空白,本文作者对 Chutes 平台过去一年的生产轨迹进行了系统性的特征分析和纵向研究。与以往工作相比,这份轨迹的独特之处在于其完整性和多样性:它涵盖了数百个模型和大量真实用户的全部生产请求,既包括访问量最高的热门模型,也包括使用稀疏的长尾模型。研究者从四个层面切入:聚合层面展示了整体流量规模和趋势;时间层面分析了请求到达率、会话长度等指标在小时、日、周尺度上的变化规律;模型层面比较了不同模型在请求量、上下文长度、生成 token 数等方面的差异;用户层面则刻画了用户调用模型的行为模式,以及用户与模型之间的二部图结构。这些分析揭示了许多在聚合视图中被掩盖的规律,例如长尾效应对缓存命中率的影响、突发流量与模型切换之间的关联等。
研究团队表示,为了支持后续研究,完整的年度轨迹数据将随论文一并发布。其他研究者和工程师可以直接基于这些真实数据开展服务系统设计、容量规划、缓存策略评估、负载均衡算法验证等工作,而无需依赖采样或人工合成的工作负载。这项工作的发布有望成为 LLM 服务系统研究的重要基准。
本论文题为“A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing”,由 William Nixon 与其他四位作者合作完成,并于 2026 年 7 月 3 日提交至 arXiv(编号:2608.13573),主题分类为人工智能(cs.AI)。论文还介绍了作者在缓存与负载均衡方面基于该轨迹的初步观察,暗示了未来的研究方向。