AI News HubLIVE
站内改写2 分钟阅读

一块GPU能容纳多少开发者?

本文探讨了自建AI编码代理推理基础设施的成本与权衡。由于API token消耗激增,许多组织开始考虑自托管GPU。文章分析了token使用模式、硬件选项(从DGX Spark到8×B200)以及并发用户对任务完成时间的影响,提供了决策参考。

来源Hacker News AI作者: flifenstein

今年上半年,AI编码代理的token成本问题引起了广泛关注。GitHub Copilot转向基于token的计费,Uber在四个月内耗尽了年度AI工具预算,开发者报告月成本从$29飙升至$750。这些现象催生了“tokenmaxxing”、“token panic”等新词。

目前,普通员工每年在AI API上的花费约为$140,但尾部效应显著:90百分位用户年花费约$7,300,99百分位接近$90,000。随着代理式AI的普及,这些数字预计将继续攀升。

成本波动的主因是AI代理的使用方式:超过70%的模型提供商ARR来自编码场景。当组织将更多工作流交给代理时,token账单随之增长。许多组织最初通过OpenAI或Anthropic等前沿模型提供商的API开始采用AI编码代理,但几个月后,由于token定价模式变贵、用户升级更贵模型以及代理采用率激增,他们开始考虑替代方案,包括API路由器、更便宜的模型层级,甚至自建推理基础设施。

自托管GPU需要仔细权衡。与按token计费的API不同,自托管意味着为底层基础设施支付24/7的费用,即使没有产生token也得付费。这取决于两个关键问题:你用了多少资源?以及能同时服务多少开发者?

实际需求并非恒定,而是具有波动性。编码任务的token使用通常在夜间接近零,上午攀升,午餐时下降,下午再次达到高峰。这意味着你需要为峰值负载购买硬件,但得全天候付费。企业推理工作负载的平均GPU利用率仅为15-22%,即使优化良好的部署也很少超过35%。不过,随着自动化代理(如调度任务、凌晨3点自动处理bug报告)的增加,这种模式可能有所改善。

从API转向自托管时,开发者体验是主要关注点。评估标准不应是每秒token数,而是任务成功完成的时间。文章引入SWEBench Pro中的编码任务来衡量不同硬件和模型组合在并发用户增加时的性能。

文章介绍了四种硬件选项:NVIDIA DGX Spark(可运行Qwen3.6-35B-A3B)、单块H200、4×H200(可运行DeepSeek-V4-Flash)以及8×B200(可运行GLM-5.2)。初步测试显示,DGX Spark最多支持1-2个并发用户,而更大配置能处理更高并发。

后续部分将深入测试结果并进行成本分析,帮助组织决定是购买GPU、租赁,还是继续使用API。