AI News HubLIVE
站内改写2 分钟阅读

智能体集群对本地AI大有益处

本文分析了本地AI开发的成本困境,指出单个智能体运行时性能有限且成本高昂。然而,通过使用智能体集群(agent swarms),可以并行处理大量任务,充分利用本地GPU资源,从而大幅降低每Token的成本。文章通过具体数据对比,展示了在本地硬件上运行集群相比API服务的显著成本优势,并预测随着智能体模式的流行,本地AI将迎来新的发展机遇。

来源Hacker News AI作者: mips_avatar

近年来,本地AI开发面临一个严峻问题:Token经济模型极为不利。要运行一个性能尚可的编码智能体,需要足够大的显存来容纳模型和上下文,这导致硬件成本非常高昂。例如,运行Qwen3.6-35B-A3B模型,理想配置是NVIDIA 5090或两块3090显卡。测试显示,单流开发时输入速度仅约2000 Token/秒,输出速度约150 Token/秒。如果每天以150 Token/秒的速度运行一小时,大约只能处理720万输入Token(80%缓存)和54万输出Token。按OpenRouter上Qwen 3.6的API价格(输入0.13美元/百万Token,输出1.00美元/百万Token,缓存Token按输入价格的十分之一计费),这样一小时的费用仅为0.80美元。由此可见,花费5000美元购置的本地计算机,其性价比还不如一台Chromebook。

然而,智能体集群(Agent Swarms)的出现彻底改变了Token经济模型。上述例子是单并发会话,即传统的“vibecoding”方式。但如今,新的范式正在兴起:将任务委派并分发给大量智能体并行处理。大型AI实验室非常青睐这种方式,因为它能大幅增加Token消耗量。但更重要的是,这使得本地LLM硬件终于有了用武之地。

假设在一小时的会话中,平均有32个后台智能体同时执行不同任务,每个智能体的输入速度为20000 Token/秒(其中14000 Token来自缓存,6000 Token为新读取),输出速度为1000 Token/秒——这是在双3090机器上常见的速度。按OpenRouter上Qwen 3.6的API价格计算,这样一小时的集群工程费用约为7.06美元。

下表对比了单智能体与32个智能体集群的Token消耗和成本:

  • 一小时内,单智能体处理720万输入Token(80%缓存)和54万输出Token;集群处理7200万输入Token(70%缓存)和360万输出Token。
  • 按API价格,单智能体成本0.80美元,集群成本7.06美元。
  • 若使用更昂贵的Sonnet 5模型,单智能体成本约9.40美元,集群成本约89美元。
  • 而在本地硬件上,单智能体电力成本仅约0.08美元,集群约0.11美元。

若按每天8小时、每月工作22天计算,单智能体使用API的年成本约192美元,集群约1700美元;使用Sonnet 5则分别高达2260美元和21400美元;而本地硬件的电费仅为19美元和26美元。

随着智能体循环和智能体图模式日益流行,本地AI将从中获益,而非被削弱。因为本地AI首次拥有了一种高效利用GPU的方法:通过大规模并行任务来饱和GPU计算能力。