AI News HubLIVE
站内改写1 分钟阅读

FineServe:细粒度的大语言模型服务负载数据集与特征分析

大语言模型作为在线服务不断部署,高效服务成为关键挑战。现有研究多依赖代理轨迹或粗粒度特征,无法捕捉多模型平台的异构性。FineServe从全球商业市场收集多模型服务负载数据,提供细粒度的真实世界动态特征。通过分析到达动态和令牌行为,揭示了不同模型架构、规模和任务意图下的波动机制,并开发了负载生成器,用于评估路由、调度和容量规划策略。

来源arXiv AI作者: Tiancheng Zhang, Shaoyuan Huang, Mingyuan Wang, Yunfeng Zhao, Xiaofei Wang, Wenyu Wang

近年来,大语言模型(LLM)作为在线服务日益普及,如何高效地服务这些模型成为系统领域的热点问题。当前,针对LLM服务负载的研究通常依赖于代理轨迹或粗粒度的特征,难以捕获多模型平台中不同模型架构、规模和任务意图带来的异构性。为了填补这一空白,由Tiancheng Zhang等五位研究者完成的论文《FineServe: A Fine-Grained Dataset and Characterization of Global LLM Serving Workloads》提出了一个全新的数据集FineServe。该数据集从全球商业市场收集了真实的多模型LLM服务负载数据,覆盖了从轻量级对话模型到大规模生成模型的广泛范围,并记录了请求到达时间、令牌生成行为等细粒度信息。利用FineServe,研究团队对到达动态和令牌行为进行了全面分析,发现了不同模型在请求到达模式上的显著差异:某些模型呈现突发性到达,而另一些则表现出周期性波动。此外,令牌消耗的长度和速率也随任务意图(如问答、摘要、代码生成)而变。基于这些洞察,他们开发了FineServe负载生成器,该生成器能够将模型感知的细粒度负载组合成可配置的混合负载,专门用于多模型服务平台的基准测试。FineServe为评估路由策略、调度算法和容量规划方案提供了现实基础,有助于提升LLM服务系统的效率。该论文还包含14页正文和14张图表,详细描述了数据收集方法、分析结果和生成器设计。数据集和代码已在GitHub上开源,供研究者和工程师使用。