AI代理框架(如OpenClaw)正在改变LLM、推理和CPU的使用方式
AI代理框架(如OpenClaw)通过将LLM的API调用编排成多步骤任务,正在改变模型构建、推理和硬件需求。小型模型在良好框架下表现优异,导致Mac Mini短缺。训练转向强化学习以优化工具调用,CPU需求激增,而GPU与专用加速器(如Groq)的结合成为趋势。未来,部分工作可能卸载到客户端设备。
经过近四年和数千亿美元的投入,人们希望AI模型能做的不仅仅是运行聊天机器人。OpenClaw等代理框架的出现,证明了LLM确实可以用于自动化复杂任务。这些框架本质上是一段代码,封装在LLM的API端点周围,编排工具调用并管理上下文。OpenClaw、Claude Code、Codex和Pi Coding Agent都是专注于代码的框架例子。
代理框架改变了我们对模型训练、构建和运行方式的思考。与传统的交易式API调用不同,框架将单个请求分解为多个步骤。例如,如果要求代码代理构建一个解析日志的应用,框架可能会先规划,再审查日志目录,然后生成并执行代码,最后调试错误。这种多步骤循环将持续到任务完成或需要用户输入。
在编码方面,这些框架已足够实用。实际上,框架对代码助手成功的影响可能比模型本身更大。即使是Qwen3.6-27B这样的小型模型,当与Claude Code或Cline等框架配合时,也能成为大型付费模型的有效替代品。这导致AI爱好者争相在Mac Mini上自托管OpenClaw和LLM,造成Mac Mini短缺。
训练方面,2024年底大型模型的收益开始递减。DeepSeek R1将推理模型和测试时缩放带入主流,通过强化学习教授模型链式思维推理。如今,越来越多的训练使用强化学习来让模型学习使用代理框架暴露的工具和资源。最近的模型发布强调代理工具调用和长上下文推理,这需要模型可靠地执行工具调用并保持信息追踪。
硬件方面,CPU重新成为焦点。Intel Xeon处理器供不应求,Meta大量购买Arm和Nvidia芯片并租用亚马逊Graviton CPU。这是因为代理框架不在GPU上运行。同时,推理成本上升,部分原因是模型运行在原本为训练设计的硬件上。最近一年半,推理优化系统如Nvidia的NVL72机架开始出现。但即使这些系统也不够,因为代理框架的多次请求使得推理性能成为瓶颈。
为应对挑战,基础设施提供商采用了GPU与专用AI加速器结合的新架构。Nvidia收购Groq并整合其语言处理单元(LPU)到GPUs中,以提高令牌生成速度。AWS使用Cerebras的晶圆级AI加速器,Intel与SambaNova合作。未来,用户端的代理框架可能将部分工作卸载到客户端设备,例如Google在Chrome中内置小型LLM。但要使这成为现实,需要大容量高速内存,这面临DRAM和NAND短缺问题。
尽管用户端框架可以减轻数据中心负载,许多人仍希望代理承担整个部门的工作。移除人类后,代理可以不受限制地工作,但不会很快终结对更强大数据中心的需求。