CPU复兴时代来临
随着智能体AI的兴起,曾被边缘化的CPU重新成为算力瓶颈。从AWS要求工程师节省CPU资源,到Intel、AMD、Arm、高通和英伟达纷纷加码服务器CPU,行业正面临一轮由智能体工作负载驱动的CPU需求激增。
智能体AI的崛起正在改写算力需求版图。今年早些时候,亚马逊网络服务(AWS)向其工程师发出了一项新指令:不惜一切代价节省CPU周期。据报道,由于AI工作负载给云计算基础设施带来巨大压力,AWS的CPU服务器容量等待时间已经大幅激增。
这一局面令AWS多少有些措手不及,因为此前的AI热潮主要刺激的是GPU和内存的需求。CPU由于并行能力相对有限,一直被视作不适合大语言模型(LLM)推理的主流用途。但允许AI模型自主运行并调用子智能体的智能体AI系统,正在改变这一叙事。
Moor Insights & Strategy的数据中心分析师Matt Kimball表示,2026年CPU需求出现明显飙升,其中很大一部分来自智能体AI。“一个智能体工作负载可能生成100个智能体,如果要推广到整个企业,这100个会变成数万、数十万甚至数百万个智能体。”他说,“这些智能体会生成子智能体,发起API调用,并通过Anthropic的模型上下文协议与其他智能体通信。”
智能体AI的“工具使用”能力是CPU需求增长的关键。工具使用指的是LLM访问互联网、打开桌面文件以及调用各种软件完成任务的能力。虽然LLM的推理过程主要在GPU或类似AI加速器上执行,但它发起的工具调用通常被交给CPU处理。Intel高级研究员Souvik Kundu解释说:“智能体AI任务中的许多环节本质上是CPU任务,比如解析输出、决定调用哪个工具、发起API调用或运行代码、收集结果并反馈。”AMD计算与企业AI副总裁Madhu Rangarajan也表示,在测试中,真实智能体AI流程的八个阶段里有七个完全在CPU上运行。
CPU和GPU之间的分工还带来了效率问题。Kundu与佐治亚理工学院研究人员合作发表的论文发现,GPU执行LLM推理时CPU常常闲置,而CPU执行工具调用时GPU又经常等待。他们提出的调度优化方案在持续负载下可将端到端延迟降低最多1.8倍。然而,智能体系统以机器速度产生任务并不断倍增。OpenAI的一次意外事件中,其模型在一小时内发起了多达300次操作,单个智能体还能生成发起工具调用的子智能体。此外,安全护栏也会增加CPU负担:对智能体行为的语法和日志检查,以及用于分析任务复杂度的小模型,往往因为低延迟要求而留在CPU上执行。
佐治亚理工学院博士生Euijun Chung合著的另一篇论文进一步揭示了CPU核心不足的后果。当服务器CPU核心过少时,分发工作到GPU的速度就跟不上,导致GPU空转等待指令。论文还强调了分词(tokenization)的瓶颈。分词将文本转换为模型可处理的整数ID,它不是大规模并行矩阵运算,而是依赖于数据的分支型字符串处理。智能体调用工具时,需要解析并分词工具结果,而且每次调用都要重新分词整个历史序列。Chung指出,如果已有10万token的上下文,再接入1000token的工具结果,分词器就必须重头处理整个序列。这既增加了分词频率,也放大了处理规模。论文表明,随着序列长度增加,首token延迟可能显著上升,而增加CPU核心数可将长序列下的首token延迟降低约1.5倍至7倍。
Chung团队受限于硬件,只测试了阿里Qwen 3-30B和Meta Llama 3.1-70B等较小模型。他推测更大模型因GPU占用更多而瓶颈相对不那么明显,但也预计智能体AI会把token长度推到远超当前测试范围。“像Anthropic的Claude,很容易达到50万甚至100万token。”Chung说,“在智能体AI的世界里,平均序列长度只会不断增长,所以这个问题在未来会更严重。”
市场信号已十分明显。Intel的服务器CPU已售罄至今年年底,AMD将服务器CPU预测翻倍,Arm和高通都发布了面向智能体AI加速的新CPU,英伟达也把Arm架构的Vera(属于Vera Rubin平台)列为智能体AI优先产品。Kimball认为,这些动向表明AI行业正重新重视CPU性能,需求激增是CPU成为智能体AI核心组件的“绝对信号”。但这也可能演变为更广泛的CPU短缺和价格上涨,正如GPU和内存此前经历的那样。Kimball警告:“你已经在某种程度上看到了CPU紧缩,这种市场约束甚至向下传导到消费端。”他还指出,Intel在18A制程带动客户端销售增长的同时,削减了客户端CPU产量,转而生产服务器CPU,这显示CPU厂商正追随利润而去。