通过自我改进的智能体加速端到端推理
Asari AI 开发了自我改进的智能体(co-inventors),能够优化整个 AI 推理栈。在 DeepSeek v4 Pro 和 GLM 5.2 上,他们将吞吐量和交互性提升了高达 16%,同时通过分布匹配检查保证了模型行为的正确性。这些智能体在多个并发级别上进行了优化,每个级别大约需要一天时间。
Asari AI 近日发布了一项研究成果,展示了其自我改进的智能体(称为“co-inventors”)如何显著加速端到端 AI 推理。这些智能体针对两个最大的开源大语言模型——DeepSeek v4 Pro 和 GLM 5.2 进行了优化,运行环境为 NVIDIA B200 GPU 和 vLLM v0.23。实验结果表明,在多个最大并发级别下,吞吐量和交互性均实现了最高 16% 的提升,同时通过分布级别的正确性检查确保了模型行为的完整性。每个并发级别的优化大约耗时一天。
截至 vLLM v0.26,智能体所做的大多数更改在上游版本中尚无对应实现。这些更改涵盖了整个推理栈,包括内核、调度器、负载均衡器和配置设置。Asari AI 强调,单一的高速内核并不足以构建一个快速系统(阿姆达尔定律),而且也不一定能保证正确性。因此,他们对整个栈进行全局优化,而不是孤立地优化单个组件。
速度只有在保持模型行为正确的前提下才是有意义的。标准基准测试如 GSM8K 或 GPQA 上的准确率无法完全反映自定义优化可能带来的微妙变化。为此,Asari AI 采用了严格的分布匹配检查,而非简单的功能测试或基准分数。
智能体具有学习能力,每次实验都会产生可重复使用的见解,从而改进其在不同模型和工作负载上的发明过程。例如,智能体学会了避免分布式死锁,这一教训最初来自优化 DeepSeek v4 Pro,后来成功应用于 GLM 5.2。死锁可能导致长达 44 分钟的不必要等待时间。
优化推理系统面临诸多挑战。智能体需要处理数百万行代码,其中包含可调参数和算法实现,以及无数服务器配置设置,搜索空间极为庞大。在正确的位置进行微小改动可能带来巨大收益,但难点在于找到这些位置并确定优先级。现代推理系统依赖于多种相互作用的因素:软件(操作系统、内核、高级脚本、运行时、调度、缓存、负载均衡、互连、客户端-服务器配置)、硬件(GPU、CPU、内存、磁盘、节点内和节点间连接)以及运行时动态(输入分布、缓存行为、内存压力、节流、网络通信)。由于这些系统高度动态,优化需要持续的评估和性能分析,静态代码分析远远不够。但端到端评估既缓慢又计算密集:一次评估可能耗时数小时,包括编译、服务器启动、预热和请求处理。
Asari AI 的“发明循环”采用严格的流程:发现与构建、评估、验证、自我改进。多个智能体并行工作,探索和实施优化策略,评估加速效果是否真实,验证是否保持了模型输出的正确性,并总结经验用于下一次迭代。
在发现与构建阶段,智能体利用动态性能分析、静态分析和自我改进机制积累的经验提出优化策略。他们通过权衡潜在加速与数值精度影响来优先排序优化目标,从而缩小搜索空间并平衡探索与利用。
评估阶段在模拟真实生产环境的沙盒中进行。智能体测试定制化的 vLLM 服务栈,用自己的优化内核和代码替换默认实现。对于参数规模达数千亿甚至数万亿的模型,运行复杂工作负载时,测量过程缓慢且固有噪声大。批处理行为的变化和硬件效应(如 GPU 功率节流)会导致性能评估的方差。Asari AI 识别并减轻了测量噪声源,确保智能体在优化过程中获得清晰反馈,然后通过统计分析和反作弊检查确保测量到的加速在生产中依然成立。
验证阶段保证加速在保持模型行为方面足够安全。小的输出误差可能在长序列中累积,降低质量。他们采用基于模型输出分布匹配的严格正确性检查,对优化模型与原始模型之间的 token 级概率分布进行统计一致性测试,使用的提示集来自 AllenAI Common Crawl C4 数据集的多语言语料库。验证频率也很关键:过于频繁会浪费计算资源,过于稀疏则会让智能体偏离轨道。
自我改进阶段,智能体从实验中提炼见解并跨模型复用,更新自身的推理、策略和知识。这些见解不仅仅是简单的事实检索,而是用于改变其工作流程和发现过程。例如,智能体学会了避免反模式、优化内核探索、改进工作流路由和评估框架连接。
优化示例包括自定义内核、内核融合、并行策略、启动开销等。大多数优化针对 M=1 瘦 GEMM 内核和胶水代码更改,这些在上游 vLLM v0.26 中无对应实现。
展望未来,Asari AI 正在构建能够长期可靠工作、具备最高严格性的实用系统设计和优化智能体。他们的共同发明过程由以下要素推动:对全系统的准确观察使智能体能推理系统级改进;正确性确保每次性能提升都可发布并产生有意义的见解;自主性让智能体能够探索人类单独无法完成的巨大空间;学习使见解不断积累,每次运行都为智能体提供更多经验。
可扩展验证仍是一个开放问题,推进其发展对于在前沿规模上实现自主优化至关重要。在早期阶段,他们实施了严格的数值公差,这为推广到更广泛的正确性概念奠定了基础。智能体可以在更一般的近似公差下进行优化,他们正在积极将共同发明者应用于不同的使用场景和部署模式。