AI代理框架(如OpenClaw)正在改變LLM、推理和CPU的使用方式
AI代理框架(如OpenClaw)透過將LLM的API呼叫編排成多步驟任務,正在改變模型構建、推理和硬體需求。小型模型在良好框架下表現優異,導致Mac Mini短缺。訓練轉向強化學習以最佳化工具呼叫,CPU需求激增,而GPU與專用加速器(如Groq)的結合成為趨勢。未來,部分工作可能解除安裝到客戶端裝置。
經過近四年和數千億美元的投入,人們希望AI模型能做的不僅僅是執行聊天機器人。OpenClaw等代理框架的出現,證明了LLM確實可以用於自動化複雜任務。這些框架本質上是一段程式碼,封裝在LLM的API端點周圍,編排工具呼叫並管理上下文。OpenClaw、Claude Code、Codex和Pi Coding Agent都是專注於程式碼的框架例子。
代理框架改變了我們對模型訓練、構建和執行方式的思考。與傳統的交易式API呼叫不同,框架將單個請求分解為多個步驟。例如,如果要求程式碼代理構建一個解析日誌的應用,框架可能會先規劃,再審查日誌目錄,然後生成並執行程式碼,最後除錯錯誤。這種多步驟迴圈將持續到任務完成或需要使用者輸入。
在編碼方面,這些框架已足夠實用。實際上,框架對程式碼助手成功的影響可能比模型本身更大。即使是Qwen3.6-27B這樣的小型模型,當與Claude Code或Cline等框架配合時,也能成為大型付費模型的有效替代品。這導致AI愛好者爭相在Mac Mini上自託管OpenClaw和LLM,造成Mac Mini短缺。
訓練方面,2024年底大型模型的收益開始遞減。DeepSeek R1將推理模型和測試時縮放帶入主流,透過強化學習教授模型鏈式思維推理。如今,越來越多的訓練使用強化學習來讓模型學習使用代理框架暴露的工具和資源。最近的模型釋出強調代理工具呼叫和長上下文推理,這需要模型可靠地執行工具呼叫並保持資訊追蹤。
硬體方面,CPU重新成為焦點。Intel Xeon處理器供不應求,Meta大量購買Arm和Nvidia晶片並租用亞馬遜Graviton CPU。這是因為代理框架不在GPU上執行。同時,推理成本上升,部分原因是模型執行在原本為訓練設計的硬體上。最近一年半,推理最佳化系統如Nvidia的NVL72機架開始出現。但即使這些系統也不夠,因為代理框架的多次請求使得推理效能成為瓶頸。
為應對挑戰,基礎設施提供商採用了GPU與專用AI加速器結合的新架構。Nvidia收購Groq並整合其語言處理單元(LPU)到GPUs中,以提高令牌生成速度。AWS使用Cerebras的晶圓級AI加速器,Intel與SambaNova合作。未來,使用者端的代理框架可能將部分工作解除安裝到客戶端裝置,例如Google在Chrome中內建小型LLM。但要使這成為現實,需要大容量高速記憶體,這面臨DRAM和NAND短缺問題。
儘管使用者端框架可以減輕資料中心負載,許多人仍希望代理承擔整個部門的工作。移除人類後,代理可以不受限制地工作,但不會很快終結對更強大數據中心的需求。