超越准确率与成本:面向动态工作负载的延迟感知LLM查询路由
现代语言查询路由器通常忽略生成延迟,而仅关注响应质量和成本。本文提出一种轻量级延迟估计器,模拟自回归标记批处理,估计首个令牌生成时间(TTFT),并将其集成到路由决策中,实现延迟、准确率和成本的联合优化。实验表明,该方法在保持与标准负载均衡相同延迟的同时,将准确率-成本效用提升了高达40%。
2026年5月13日,一篇题为《超越准确率与成本:面向动态工作负载的延迟感知LLM查询路由》的论文由Shivam Patel等四位作者提交至arXiv(编号2607.18253)。该论文直击当前大语言模型(LLM)推理系统中的关键痛点:查询路由器的延迟盲区。现有路由器通常将查询分配给能平衡响应质量与金钱成本的模型,但几乎完全忽略了生成延迟。在动态工作负载环境下,延迟往往由轮询或最短队列等负载均衡策略控制,这些策略并不考虑模型准确率或推理费用,导致用户感知的响应时间不可预测。
研究团队指出,将查询延迟纳入路由决策绝非易事,因为延迟不仅取决于查询的提示长度,还深受模型实例当前预填充和解码工作负载、服务框架的调度与批处理策略的影响。为此,他们创新性地设计了一种轻量级延迟估计器,能够模拟服务框架中自回归令牌的批处理过程,从而准确估算查询的首个令牌生成时间(TTFT)。该估计器无需侵入式监控,计算开销极低,适合在线推理场景。
基于这一估计器,团队构建了一个延迟感知的路由器。在分配查询时,该路由器将延迟、准确率和成本纳入联合优化目标,而非传统方法仅考虑其一或其二。实验结果表明,与标准负载均衡方法相比,这种联合优化在保持相同延迟水平的同时,将准确率-成本效用提升了高达40%。这意味着,在不牺牲用户响应速度的前提下,系统可以显著提升回答质量或降低推理成本。
该研究为动态工作负载下的LLM推理效率优化开辟了新路径。随着LLM服务化部署的普及,延迟感知的路由策略有望成为下一代推理系统的标准组件,尤其适用于交互式应用(如聊天机器人)和成本敏感的云计算场景。未来工作可能包括扩展到多模态模型、考虑尾部延迟优化等方向。