AI News HubLIVE
站內改寫1 分鐘閱讀

ThunderAgent:大規模合成資料生成的2倍加速智慧體推理

ThunderAgent是一種程式感知的智慧體推理排程器。透過將每個智慧體工作流視為可排程的程式,它消除了KV快取顛簸,實現了超過2倍的單節點吞吐量和近線性的多節點擴充套件。

ThunderAgent是一種為高吞吐量智慧體推理設計的系統。隨著LLM越來越多地以智慧體形式部署(如Claude Code、Codex等),大規模合成資料生成成為訓練這些智慧體的關鍵。然而,現有推理引擎在請求級別排程,無法感知多輪工作流,導致KV快取顛簸、多節點負載不均等問題。ThunderAgent透過引入程式抽象來解決這些問題:它將每個智慧體工作流抽象為一個可排程程式,跟蹤其執行階段、KV快取佔用和節點位置。在記憶體壓力下,ThunderAgent透過程式級准入控制暫停低優先順序工作流,減少快取競爭,從而顯著提高快取命中率並降低延遲。當暫停的工作流準備恢復時,透過全域性等待佇列將其路由到容量最充足的節點,實現跨叢集負載均衡。評估結果表明,在單個8×H100節點上,ThunderAgent在批處理大小為192時達到803 token/s的吞吐量,而SGLang僅為390 token/s,同時延遲從65秒降至10.6秒。在多節點叢集上,從2節點到8節點,ThunderAgent的加速比從1.79倍擴充套件到2.39倍,吞吐量隨GPU數量近線性增長。ThunderAgent設計為可輕鬆整合到現有堆疊中,與OpenAI相容的端點以及量化、推測解碼等最佳化配合使用,僅需客戶端新增program_id欄位。該專案已開源,並被SkyRL和NVIDIA Dynamo等框架採用。作者認為程式抽象是下一代智慧體推理系統的基礎。