AI News HubLIVE
站內改寫1 分鐘閱讀

讓AI代理用VibeServe編寫你的服務棧

VibeServe是一個多代理系統,能夠為特定的模型、硬件和工作負載端到端合成定製的大語言模型服務運行時。在標準設置上與vLLM和SGLang相當,在非標準場景中實現1.69倍到6.27倍的加速,展示了AI代理在系統構建中的潛力。

來源Hacker News AI作者: matt_d

VibeServe是一個多代理系統,旨在為大規模語言模型(LLM)服務生成定製的運行時。與通用服務棧相比,它針對特定的模型、硬件和工作負載進行優化,從而在保持主流場景性能的同時,在非標準部署上實現顯著加速。

通用LLM服務棧(如vLLM)雖然覆蓋了主流用例,但在長尾場景中往往無法充分發揮硬件潛力。VibeServe採用一種新穎的雙層優化循環:外循環負責搜索策略,維護待辦事項、長期記憶和已驗證檢查點的git歷史;內循環包含三個專門代理——實現者、準確性評判者和性能評估者——它們在共享工作空間上協作。這種設計避免了單一代理的上下文漂移問題,確保優化方向正確。

在評估中,VibeServe展示了強大的性能。在標準設置(Llama-3.1-8B on H100)下,它經過60次迭代後與vLLM和SGLang達到性能等價。在非標準場景中,加速效果更為顯著:

  • 代碼編輯工作負載(Qwen3-32B on H100)下,通過預測輸出接口獲得5.95倍加速,遠超vLLM的推測解碼。
  • 混合架構模型(Olmo-Hybrid-7B on L4)在RAG風格工作負載下,利用狀態快照技術實現3.45倍加速。
  • 流式ASR(Moonshine on L4)的TTFT加速達到1.69倍。

VibeServe的核心優勢在於其技能庫,該庫從現有服務引擎和文獻中提煉技術,如連續批處理、分頁KV緩存和FlashAttention變體。新模型、加速器和優化可以以新技能條目的形式添加,無需修改框架本身。

這項研究來自華盛頓大學,論文和代碼均已公開。VibeServe為AI代理構建整個系統端到端提供了有力證據,並在長期性能優化上超越了人工設計的基線。此外,VibeServe還展示了AI代理在系統研究中的潛力,通過自動生成針對特定部署的運行時,解決了通用服務棧在長尾場景中的效率問題。未來,隨着技能庫的擴展和代理能力的提升,VibeServe有望進一步推動LLM服務系統的自動化和定製化。