跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

ThunderAgent:大規模合成資料生成的2倍加速智慧體推理

文章摘要

ThunderAgent是一種程式感知的智慧體推理排程器。透過將每個智慧體工作流視為可排程的程式,它消除了KV快取顛簸,實現了超過2倍的單節點吞吐量和近線性的多節點擴充套件。

ThunderAgent:大規模合成資料生成的2倍加速智慧體推理
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

ThunderAgent是一種為高吞吐量智慧體推理設計的系統。隨著LLM越來越多地以智慧體形式部署(如Claude Code、Codex等),大規模合成資料生成成為訓練這些智慧體的關鍵。然而,現有推理引擎在請求級別排程,無法感知多輪工作流,導致KV快取顛簸、多節點負載不均等問題。ThunderAgent透過引入程式抽象來解決這些問題:它將每個智慧體工作流抽象為一個可排程程式,跟蹤其執行階段、KV快取佔用和節點位置。在記憶體壓力下,ThunderAgent透過程式級准入控制暫停低優先順序工作流,減少快取競爭,從而顯著提高快取命中率並降低延遲。當暫停的工作流準備恢復時,透過全域性等待佇列將其路由到容量最充足的節點,實現跨叢集負載均衡。評估結果表明,在單個8×H100節點上,ThunderAgent在批處理大小為192時達到803 token/s的吞吐量,而SGLang僅為390 token/s,同時延遲從65秒降至10.6秒。在多節點叢集上,從2節點到8節點,ThunderAgent的加速比從1.79倍擴充套件到2.39倍,吞吐量隨GPU數量近線性增長。ThunderAgent設計為可輕鬆整合到現有堆疊中,與OpenAI相容的端點以及量化、推測解碼等最佳化配合使用,僅需客戶端新增program_id欄位。該專案已開源,並被SkyRL和NVIDIA Dynamo等框架採用。作者認為程式抽象是下一代智慧體推理系統的基礎。

展開要點與分析

文章情報

工程師進階

要點

  • 引入程式抽象用於智慧體LLM請求排程,消除KV快取顛簸
  • 在單節點上實現高達2.5倍的吞吐量提升,8節點叢集上實現2.4倍加速
  • 相容現有推理後端,僅需新增program_id欄位
  • 已被SkyRL和NVIDIA Dynamo等開源框架採用
  • 被ICML 2026接收為亮點論文

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。