讓AI代理用VibeServe編寫你的服務棧
VibeServe是一個多代理系統,能夠為特定的模型、硬體和工作負載端到端合成定製的大語言模型服務執行時。在標準設定上與vLLM和SGLang相當,在非標準場景中實現1.69倍到6.27倍的加速,展示了AI代理在系統構建中的潛力。
VibeServe是一個多代理系統,旨在為大規模語言模型(LLM)服務生成定製的執行時。與通用服務棧相比,它針對特定的模型、硬體和工作負載進行最佳化,從而在保持主流場景效能的同時,在非標準部署上實現顯著加速。
通用LLM服務棧(如vLLM)雖然覆蓋了主流用例,但在長尾場景中往往無法充分發揮硬體潛力。VibeServe採用一種新穎的雙層最佳化迴圈:外迴圈負責搜尋策略,維護待辦事項、長期記憶和已驗證檢查點的git歷史;內迴圈包含三個專門代理——實現者、準確性評判者和效能評估者——它們在共享工作空間上協作。這種設計避免了單一代理的上下文漂移問題,確保最佳化方向正確。
在評估中,VibeServe展示了強大的效能。在標準設定(Llama-3.1-8B on H100)下,它經過60次迭代後與vLLM和SGLang達到效能等價。在非標準場景中,加速效果更為顯著:
- 程式碼編輯工作負載(Qwen3-32B on H100)下,透過預測輸出介面獲得5.95倍加速,遠超vLLM的推測解碼。
- 混合架構模型(Olmo-Hybrid-7B on L4)在RAG風格工作負載下,利用狀態快照技術實現3.45倍加速。
- 流式ASR(Moonshine on L4)的TTFT加速達到1.69倍。
VibeServe的核心優勢在於其技能庫,該庫從現有服務引擎和文獻中提煉技術,如連續批處理、分頁KV快取和FlashAttention變體。新模型、加速器和最佳化可以以新技能條目的形式新增,無需修改框架本身。
這項研究來自華盛頓大學,論文和程式碼均已公開。VibeServe為AI代理構建整個系統端到端提供了有力證據,並在長期效能最佳化上超越了人工設計的基線。此外,VibeServe還展示了AI代理在系統研究中的潛力,透過自動生成針對特定部署的執行時,解決了通用服務棧在長尾場景中的效率問題。未來,隨著技能庫的擴充套件和代理能力的提升,VibeServe有望進一步推動LLM服務系統的自動化和定製化。