ThunderAgent:大规模合成数据生成的2倍加速智能体推理
ThunderAgent是一种程序感知的智能体推理调度器。通过将每个智能体工作流视为可调度的程序,它消除了KV缓存颠簸,实现了超过2倍的单节点吞吐量和近线性的多节点扩展。
ThunderAgent是一种为高吞吐量智能体推理设计的系统。随着LLM越来越多地以智能体形式部署(如Claude Code、Codex等),大规模合成数据生成成为训练这些智能体的关键。然而,现有推理引擎在请求级别调度,无法感知多轮工作流,导致KV缓存颠簸、多节点负载不均等问题。ThunderAgent通过引入程序抽象来解决这些问题:它将每个智能体工作流抽象为一个可调度程序,跟踪其执行阶段、KV缓存占用和节点位置。在内存压力下,ThunderAgent通过程序级准入控制暂停低优先级工作流,减少缓存竞争,从而显著提高缓存命中率并降低延迟。当暂停的工作流准备恢复时,通过全局等待队列将其路由到容量最充足的节点,实现跨集群负载均衡。评估结果表明,在单个8×H100节点上,ThunderAgent在批处理大小为192时达到803 token/s的吞吐量,而SGLang仅为390 token/s,同时延迟从65秒降至10.6秒。在多节点集群上,从2节点到8节点,ThunderAgent的加速比从1.79倍扩展到2.39倍,吞吐量随GPU数量近线性增长。ThunderAgent设计为可轻松集成到现有堆栈中,与OpenAI兼容的端点以及量化、推测解码等优化配合使用,仅需客户端添加program_id字段。该项目已开源,并被SkyRL和NVIDIA Dynamo等框架采用。作者认为程序抽象是下一代智能体推理系统的基础。