跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

ThunderAgent:大规模合成数据生成的2倍加速智能体推理

文章摘要

ThunderAgent是一种程序感知的智能体推理调度器。通过将每个智能体工作流视为可调度的程序,它消除了KV缓存颠簸,实现了超过2倍的单节点吞吐量和近线性的多节点扩展。

ThunderAgent:大规模合成数据生成的2倍加速智能体推理
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

ThunderAgent是一种为高吞吐量智能体推理设计的系统。随着LLM越来越多地以智能体形式部署(如Claude Code、Codex等),大规模合成数据生成成为训练这些智能体的关键。然而,现有推理引擎在请求级别调度,无法感知多轮工作流,导致KV缓存颠簸、多节点负载不均等问题。ThunderAgent通过引入程序抽象来解决这些问题:它将每个智能体工作流抽象为一个可调度程序,跟踪其执行阶段、KV缓存占用和节点位置。在内存压力下,ThunderAgent通过程序级准入控制暂停低优先级工作流,减少缓存竞争,从而显著提高缓存命中率并降低延迟。当暂停的工作流准备恢复时,通过全局等待队列将其路由到容量最充足的节点,实现跨集群负载均衡。评估结果表明,在单个8×H100节点上,ThunderAgent在批处理大小为192时达到803 token/s的吞吐量,而SGLang仅为390 token/s,同时延迟从65秒降至10.6秒。在多节点集群上,从2节点到8节点,ThunderAgent的加速比从1.79倍扩展到2.39倍,吞吐量随GPU数量近线性增长。ThunderAgent设计为可轻松集成到现有堆栈中,与OpenAI兼容的端点以及量化、推测解码等优化配合使用,仅需客户端添加program_id字段。该项目已开源,并被SkyRL和NVIDIA Dynamo等框架采用。作者认为程序抽象是下一代智能体推理系统的基础。

展开要点与分析

文章情报

工程师进阶

要点

  • 引入程序抽象用于智能体LLM请求调度,消除KV缓存颠簸
  • 在单节点上实现高达2.5倍的吞吐量提升,8节点集群上实现2.4倍加速
  • 兼容现有推理后端,仅需添加program_id字段
  • 已被SkyRL和NVIDIA Dynamo等开源框架采用
  • 被ICML 2026接收为亮点论文

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。