让AI代理用VibeServe编写你的服务栈
VibeServe是一个多代理系统,能够为特定的模型、硬件和工作负载端到端合成定制的大语言模型服务运行时。在标准设置上与vLLM和SGLang相当,在非标准场景中实现1.69倍到6.27倍的加速,展示了AI代理在系统构建中的潜力。
VibeServe是一个多代理系统,旨在为大规模语言模型(LLM)服务生成定制的运行时。与通用服务栈相比,它针对特定的模型、硬件和工作负载进行优化,从而在保持主流场景性能的同时,在非标准部署上实现显著加速。
通用LLM服务栈(如vLLM)虽然覆盖了主流用例,但在长尾场景中往往无法充分发挥硬件潜力。VibeServe采用一种新颖的双层优化循环:外循环负责搜索策略,维护待办事项、长期记忆和已验证检查点的git历史;内循环包含三个专门代理——实现者、准确性评判者和性能评估者——它们在共享工作空间上协作。这种设计避免了单一代理的上下文漂移问题,确保优化方向正确。
在评估中,VibeServe展示了强大的性能。在标准设置(Llama-3.1-8B on H100)下,它经过60次迭代后与vLLM和SGLang达到性能等价。在非标准场景中,加速效果更为显著:
- 代码编辑工作负载(Qwen3-32B on H100)下,通过预测输出接口获得5.95倍加速,远超vLLM的推测解码。
- 混合架构模型(Olmo-Hybrid-7B on L4)在RAG风格工作负载下,利用状态快照技术实现3.45倍加速。
- 流式ASR(Moonshine on L4)的TTFT加速达到1.69倍。
VibeServe的核心优势在于其技能库,该库从现有服务引擎和文献中提炼技术,如连续批处理、分页KV缓存和FlashAttention变体。新模型、加速器和优化可以以新技能条目的形式添加,无需修改框架本身。
这项研究来自华盛顿大学,论文和代码均已公开。VibeServe为AI代理构建整个系统端到端提供了有力证据,并在长期性能优化上超越了人工设计的基线。此外,VibeServe还展示了AI代理在系统研究中的潜力,通过自动生成针对特定部署的运行时,解决了通用服务栈在长尾场景中的效率问题。未来,随着技能库的扩展和代理能力的提升,VibeServe有望进一步推动LLM服务系统的自动化和定制化。