通過自我改進的智能體加速端到端推理
Asari AI 開發了自我改進的智能體(co-inventors),能夠優化整個 AI 推理棧。在 DeepSeek v4 Pro 和 GLM 5.2 上,他們將吞吐量和交互性提升了高達 16%,同時通過分佈匹配檢查保證了模型行為的正確性。這些智能體在多個併發級別上進行了優化,每個級別大約需要一天時間。
Asari AI 近日發佈了一項研究成果,展示了其自我改進的智能體(稱為“co-inventors”)如何顯著加速端到端 AI 推理。這些智能體針對兩個最大的開源大語言模型——DeepSeek v4 Pro 和 GLM 5.2 進行了優化,運行環境為 NVIDIA B200 GPU 和 vLLM v0.23。實驗結果表明,在多個最大併發級別下,吞吐量和交互性均實現了最高 16% 的提升,同時通過分佈級別的正確性檢查確保了模型行為的完整性。每個併發級別的優化大約耗時一天。
截至 vLLM v0.26,智能體所做的大多數更改在上游版本中尚無對應實現。這些更改涵蓋了整個推理棧,包括內核、調度器、負載均衡器和配置設置。Asari AI 強調,單一的高速內核並不足以構建一個快速系統(阿姆達爾定律),而且也不一定能保證正確性。因此,他們對整個棧進行全局優化,而不是孤立地優化單個組件。
速度只有在保持模型行為正確的前提下才是有意義的。標準基準測試如 GSM8K 或 GPQA 上的準確率無法完全反映自定義優化可能帶來的微妙變化。為此,Asari AI 採用了嚴格的分佈匹配檢查,而非簡單的功能測試或基準分數。
智能體具有學習能力,每次實驗都會產生可重複使用的見解,從而改進其在不同模型和工作負載上的發明過程。例如,智能體學會了避免分佈式死鎖,這一教訓最初來自優化 DeepSeek v4 Pro,後來成功應用於 GLM 5.2。死鎖可能導致長達 44 分鐘的不必要等待時間。
優化推理系統面臨諸多挑戰。智能體需要處理數百萬行代碼,其中包含可調參數和算法實現,以及無數服務器配置設置,搜索空間極為龐大。在正確的位置進行微小改動可能帶來巨大收益,但難點在於找到這些位置並確定優先級。現代推理系統依賴於多種相互作用的因素:軟件(操作系統、內核、高級腳本、運行時、調度、緩存、負載均衡、互連、客户端-服務器配置)、硬件(GPU、CPU、內存、磁盤、節點內和節點間連接)以及運行時動態(輸入分佈、緩存行為、內存壓力、節流、網絡通信)。由於這些系統高度動態,優化需要持續的評估和性能分析,靜態代碼分析遠遠不夠。但端到端評估既緩慢又計算密集:一次評估可能耗時數小時,包括編譯、服務器啓動、預熱和請求處理。
Asari AI 的“發明循環”採用嚴格的流程:發現與構建、評估、驗證、自我改進。多個智能體並行工作,探索和實施優化策略,評估加速效果是否真實,驗證是否保持了模型輸出的正確性,並總結經驗用於下一次迭代。
在發現與構建階段,智能體利用動態性能分析、靜態分析和自我改進機制積累的經驗提出優化策略。他們通過權衡潛在加速與數值精度影響來優先排序優化目標,從而縮小搜索空間並平衡探索與利用。
評估階段在模擬真實生產環境的沙盒中進行。智能體測試定製化的 vLLM 服務棧,用自己的優化內核和代碼替換默認實現。對於參數規模達數千億甚至數萬億的模型,運行復雜工作負載時,測量過程緩慢且固有噪聲大。批處理行為的變化和硬件效應(如 GPU 功率節流)會導致性能評估的方差。Asari AI 識別並減輕了測量噪聲源,確保智能體在優化過程中獲得清晰反饋,然後通過統計分析和反作弊檢查確保測量到的加速在生產中依然成立。
驗證階段保證加速在保持模型行為方面足夠安全。小的輸出誤差可能在長序列中累積,降低質量。他們採用基於模型輸出分佈匹配的嚴格正確性檢查,對優化模型與原始模型之間的 token 級概率分佈進行統計一致性測試,使用的提示集來自 AllenAI Common Crawl C4 數據集的多語言語料庫。驗證頻率也很關鍵:過於頻繁會浪費計算資源,過於稀疏則會讓智能體偏離軌道。
自我改進階段,智能體從實驗中提煉見解並跨模型複用,更新自身的推理、策略和知識。這些見解不僅僅是簡單的事實檢索,而是用於改變其工作流程和發現過程。例如,智能體學會了避免反模式、優化內核探索、改進工作流路由和評估框架連接。
優化示例包括自定義內核、內核融合、並行策略、啓動開銷等。大多數優化針對 M=1 瘦 GEMM 內核和膠水代碼更改,這些在上游 vLLM v0.26 中無對應實現。
展望未來,Asari AI 正在構建能夠長期可靠工作、具備最高嚴格性的實用系統設計和優化智能體。他們的共同發明過程由以下要素推動:對全系統的準確觀察使智能體能推理系統級改進;正確性確保每次性能提升都可發佈併產生有意義的見解;自主性讓智能體能夠探索人類單獨無法完成的巨大空間;學習使見解不斷積累,每次運行都為智能體提供更多經驗。
可擴展驗證仍是一個開放問題,推進其發展對於在前沿規模上實現自主優化至關重要。在早期階段,他們實施了嚴格的數值公差,這為推廣到更廣泛的正確性概念奠定了基礎。智能體可以在更一般的近似公差下進行優化,他們正在積極將共同發明者應用於不同的使用場景和部署模式。