跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

ThunderAgent:大規模合成數據生成的2倍加速智能體推理

文章摘要

ThunderAgent是一種程序感知的智能體推理調度器。通過將每個智能體工作流視為可調度的程序,它消除了KV緩存顛簸,實現了超過2倍的單節點吞吐量和近線性的多節點擴展。

ThunderAgent:大規模合成數據生成的2倍加速智能體推理
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

ThunderAgent是一種為高吞吐量智能體推理設計的系統。隨着LLM越來越多地以智能體形式部署(如Claude Code、Codex等),大規模合成數據生成成為訓練這些智能體的關鍵。然而,現有推理引擎在請求級別調度,無法感知多輪工作流,導致KV緩存顛簸、多節點負載不均等問題。ThunderAgent通過引入程序抽象來解決這些問題:它將每個智能體工作流抽象為一個可調度程序,跟蹤其執行階段、KV緩存佔用和節點位置。在內存壓力下,ThunderAgent通過程序級准入控制暫停低優先級工作流,減少緩存競爭,從而顯著提高緩存命中率並降低延遲。當暫停的工作流準備恢復時,通過全局等待隊列將其路由到容量最充足的節點,實現跨集羣負載均衡。評估結果表明,在單個8×H100節點上,ThunderAgent在批處理大小為192時達到803 token/s的吞吐量,而SGLang僅為390 token/s,同時延遲從65秒降至10.6秒。在多節點集羣上,從2節點到8節點,ThunderAgent的加速比從1.79倍擴展到2.39倍,吞吐量隨GPU數量近線性增長。ThunderAgent設計為可輕鬆集成到現有堆棧中,與OpenAI兼容的端點以及量化、推測解碼等優化配合使用,僅需客户端添加program_id字段。該項目已開源,並被SkyRL和NVIDIA Dynamo等框架採用。作者認為程序抽象是下一代智能體推理系統的基礎。

展開要點與分析

文章情報

工程師進階

要點

  • 引入程序抽象用於智能體LLM請求調度,消除KV緩存顛簸
  • 在單節點上實現高達2.5倍的吞吐量提升,8節點集羣上實現2.4倍加速
  • 兼容現有推理後端,僅需添加program_id字段
  • 已被SkyRL和NVIDIA Dynamo等開源框架採用
  • 被ICML 2026接收為亮點論文

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。