透過自我改進的智慧體加速端到端推理
Asari AI 開發了自我改進的智慧體(co-inventors),能夠最佳化整個 AI 推理棧。在 DeepSeek v4 Pro 和 GLM 5.2 上,他們將吞吐量和互動性提升了高達 16%,同時透過分佈匹配檢查保證了模型行為的正確性。這些智慧體在多個併發級別上進行了最佳化,每個級別大約需要一天時間。
Asari AI 近日釋出了一項研究成果,展示了其自我改進的智慧體(稱為“co-inventors”)如何顯著加速端到端 AI 推理。這些智慧體針對兩個最大的開源大語言模型——DeepSeek v4 Pro 和 GLM 5.2 進行了最佳化,執行環境為 NVIDIA B200 GPU 和 vLLM v0.23。實驗結果表明,在多個最大併發級別下,吞吐量和互動性均實現了最高 16% 的提升,同時透過分佈級別的正確性檢查確保了模型行為的完整性。每個併發級別的最佳化大約耗時一天。
截至 vLLM v0.26,智慧體所做的大多數更改在上游版本中尚無對應實現。這些更改涵蓋了整個推理棧,包括核心、排程器、負載均衡器和配置設定。Asari AI 強調,單一的高速核心並不足以構建一個快速系統(阿姆達爾定律),而且也不一定能保證正確性。因此,他們對整個棧進行全域性最佳化,而不是孤立地最佳化單個元件。
速度只有在保持模型行為正確的前提下才是有意義的。標準基準測試如 GSM8K 或 GPQA 上的準確率無法完全反映自定義最佳化可能帶來的微妙變化。為此,Asari AI 採用了嚴格的分佈匹配檢查,而非簡單的功能測試或基準分數。
智慧體具有學習能力,每次實驗都會產生可重複使用的見解,從而改進其在不同模型和工作負載上的發明過程。例如,智慧體學會了避免分散式死鎖,這一教訓最初來自最佳化 DeepSeek v4 Pro,後來成功應用於 GLM 5.2。死鎖可能導致長達 44 分鐘的不必要等待時間。
最佳化推理系統面臨諸多挑戰。智慧體需要處理數百萬行程式碼,其中包含可調引數和演算法實現,以及無數伺服器配置設定,搜尋空間極為龐大。在正確的位置進行微小改動可能帶來巨大收益,但難點在於找到這些位置並確定優先順序。現代推理系統依賴於多種相互作用的因素:軟體(作業系統、核心、高階指令碼、執行時、排程、快取、負載均衡、互連、客戶端-伺服器配置)、硬體(GPU、CPU、記憶體、磁碟、節點內和節點間連線)以及執行時動態(輸入分佈、快取行為、記憶體壓力、節流、網路通訊)。由於這些系統高度動態,最佳化需要持續的評估和效能分析,靜態程式碼分析遠遠不夠。但端到端評估既緩慢又計算密集:一次評估可能耗時數小時,包括編譯、伺服器啟動、預熱和請求處理。
Asari AI 的“發明迴圈”採用嚴格的流程:發現與構建、評估、驗證、自我改進。多個智慧體並行工作,探索和實施最佳化策略,評估加速效果是否真實,驗證是否保持了模型輸出的正確性,並總結經驗用於下一次迭代。
在發現與構建階段,智慧體利用動態效能分析、靜態分析和自我改進機制積累的經驗提出最佳化策略。他們透過權衡潛在加速與數值精度影響來優先排序最佳化目標,從而縮小搜尋空間並平衡探索與利用。
評估階段在模擬真實生產環境的沙盒中進行。智慧體測試定製化的 vLLM 服務棧,用自己的最佳化核心和程式碼替換預設實現。對於引數規模達數千億甚至數萬億的模型,執行復雜工作負載時,測量過程緩慢且固有噪聲大。批處理行為的變化和硬體效應(如 GPU 功率節流)會導致效能評估的方差。Asari AI 識別並減輕了測量噪聲源,確保智慧體在最佳化過程中獲得清晰反饋,然後透過統計分析和反作弊檢查確保測量到的加速在生產中依然成立。
驗證階段保證加速在保持模型行為方面足夠安全。小的輸出誤差可能在長序列中累積,降低質量。他們採用基於模型輸出分佈匹配的嚴格正確性檢查,對最佳化模型與原始模型之間的 token 級機率分佈進行統計一致性測試,使用的提示集來自 AllenAI Common Crawl C4 資料集的多語言語料庫。驗證頻率也很關鍵:過於頻繁會浪費計算資源,過於稀疏則會讓智慧體偏離軌道。
自我改進階段,智慧體從實驗中提煉見解並跨模型複用,更新自身的推理、策略和知識。這些見解不僅僅是簡單的事實檢索,而是用於改變其工作流程和發現過程。例如,智慧體學會了避免反模式、最佳化核心探索、改進工作流路由和評估框架連線。
最佳化示例包括自定義核心、核心融合、並行策略、啟動開銷等。大多數最佳化針對 M=1 瘦 GEMM 核心和膠水程式碼更改,這些在上游 vLLM v0.26 中無對應實現。
展望未來,Asari AI 正在構建能夠長期可靠工作、具備最高嚴格性的實用系統設計和最佳化智慧體。他們的共同發明過程由以下要素推動:對全系統的準確觀察使智慧體能推理系統級改進;正確性確保每次效能提升都可釋出併產生有意義的見解;自主性讓智慧體能夠探索人類單獨無法完成的巨大空間;學習使見解不斷積累,每次執行都為智慧體提供更多經驗。
可擴充套件驗證仍是一個開放問題,推進其發展對於在前沿規模上實現自主最佳化至關重要。在早期階段,他們實施了嚴格的數值公差,這為推廣到更廣泛的正確性概念奠定了基礎。智慧體可以在更一般的近似公差下進行最佳化,他們正在積極將共同發明者應用於不同的使用場景和部署模式。