AI代理框架(如OpenClaw)正在改變LLM、推理和CPU的使用方式
AI代理框架(如OpenClaw)通過將LLM的API調用編排成多步驟任務,正在改變模型構建、推理和硬件需求。小型模型在良好框架下表現優異,導致Mac Mini短缺。訓練轉向強化學習以優化工具調用,CPU需求激增,而GPU與專用加速器(如Groq)的結合成為趨勢。未來,部分工作可能卸載到客户端設備。
經過近四年和數千億美元的投入,人們希望AI模型能做的不僅僅是運行聊天機器人。OpenClaw等代理框架的出現,證明了LLM確實可以用於自動化複雜任務。這些框架本質上是一段代碼,封裝在LLM的API端點周圍,編排工具調用並管理上下文。OpenClaw、Claude Code、Codex和Pi Coding Agent都是專注於代碼的框架例子。
代理框架改變了我們對模型訓練、構建和運行方式的思考。與傳統的交易式API調用不同,框架將單個請求分解為多個步驟。例如,如果要求代碼代理構建一個解析日誌的應用,框架可能會先規劃,再審查日誌目錄,然後生成並執行代碼,最後調試錯誤。這種多步驟循環將持續到任務完成或需要用户輸入。
在編碼方面,這些框架已足夠實用。實際上,框架對代碼助手成功的影響可能比模型本身更大。即使是Qwen3.6-27B這樣的小型模型,當與Claude Code或Cline等框架配合時,也能成為大型付費模型的有效替代品。這導致AI愛好者爭相在Mac Mini上自託管OpenClaw和LLM,造成Mac Mini短缺。
訓練方面,2024年底大型模型的收益開始遞減。DeepSeek R1將推理模型和測試時縮放帶入主流,通過強化學習教授模型鏈式思維推理。如今,越來越多的訓練使用強化學習來讓模型學習使用代理框架暴露的工具和資源。最近的模型發佈強調代理工具調用和長上下文推理,這需要模型可靠地執行工具調用並保持信息追蹤。
硬件方面,CPU重新成為焦點。Intel Xeon處理器供不應求,Meta大量購買Arm和Nvidia芯片並租用亞馬遜Graviton CPU。這是因為代理框架不在GPU上運行。同時,推理成本上升,部分原因是模型運行在原本為訓練設計的硬件上。最近一年半,推理優化系統如Nvidia的NVL72機架開始出現。但即使這些系統也不夠,因為代理框架的多次請求使得推理性能成為瓶頸。
為應對挑戰,基礎設施提供商採用了GPU與專用AI加速器結合的新架構。Nvidia收購Groq並整合其語言處理單元(LPU)到GPUs中,以提高令牌生成速度。AWS使用Cerebras的晶圓級AI加速器,Intel與SambaNova合作。未來,用户端的代理框架可能將部分工作卸載到客户端設備,例如Google在Chrome中內置小型LLM。但要使這成為現實,需要大容量高速內存,這面臨DRAM和NAND短缺問題。
儘管用户端框架可以減輕數據中心負載,許多人仍希望代理承擔整個部門的工作。移除人類後,代理可以不受限制地工作,但不會很快終結對更強大數據中心的需求。