ThunderAgent:大規模合成數據生成的2倍加速智能體推理
ThunderAgent是一種程序感知的智能體推理調度器。通過將每個智能體工作流視為可調度的程序,它消除了KV緩存顛簸,實現了超過2倍的單節點吞吐量和近線性的多節點擴展。
ThunderAgent是一種為高吞吐量智能體推理設計的系統。隨着LLM越來越多地以智能體形式部署(如Claude Code、Codex等),大規模合成數據生成成為訓練這些智能體的關鍵。然而,現有推理引擎在請求級別調度,無法感知多輪工作流,導致KV緩存顛簸、多節點負載不均等問題。ThunderAgent通過引入程序抽象來解決這些問題:它將每個智能體工作流抽象為一個可調度程序,跟蹤其執行階段、KV緩存佔用和節點位置。在內存壓力下,ThunderAgent通過程序級准入控制暫停低優先級工作流,減少緩存競爭,從而顯著提高緩存命中率並降低延遲。當暫停的工作流準備恢復時,通過全局等待隊列將其路由到容量最充足的節點,實現跨集羣負載均衡。評估結果表明,在單個8×H100節點上,ThunderAgent在批處理大小為192時達到803 token/s的吞吐量,而SGLang僅為390 token/s,同時延遲從65秒降至10.6秒。在多節點集羣上,從2節點到8節點,ThunderAgent的加速比從1.79倍擴展到2.39倍,吞吐量隨GPU數量近線性增長。ThunderAgent設計為可輕鬆集成到現有堆棧中,與OpenAI兼容的端點以及量化、推測解碼等優化配合使用,僅需客户端添加program_id字段。該項目已開源,並被SkyRL和NVIDIA Dynamo等框架採用。作者認為程序抽象是下一代智能體推理系統的基礎。