AI News HubLIVE
站内改写4 分钟阅读

AI支出现被视为劳动力成本

公司对AI工具的成本控制日益严格,但将AI支出与劳动力成本对比时,其价值可能被重新评估。本文通过分析Uber、Tesla的预算限制以及Bun重写的案例,探讨了AI支出应如何归类。

来源Hacker News AI作者: konmam

上个月,我在关于Fable 5的文章结尾提到,越来越多企业开始审视自己的AI成本。此后情况并未减缓,因此本文深入探讨这一趋势。

一年前,企业还鼓励工程师大量使用AI。Uber内部设有排行榜,按Claude Code使用量排序工程师,消耗更多token被视为积极信号。但今年春天,同一批公司开始设置上限。Uber在四个月内用尽了2026年全年AI编程预算,现限制工程师每工具每月1500美元。Tesla从排行榜转向每周200美元的上限。微软则撤回了大部分内部Claude Code许可证,转而推广自家的Copilot。

这些故事背后的账单是真实的,恐慌也有其道理。但我认为,目前的限制措施将AI支出对错了预算科目。

账单为何暴涨

理解资金去向的最好方式是关注单一任务而非整体账单。当Uber的CTO内部演示智能体编程时,一场两小时的演示花费了1200美元,且一切顺利。这仅仅是智能体在规划、读取文件、调用工具、审查输出和重试时产生的正常成本,每轮都携带之前所有轮次的完整历史。

部分成本在智能体执行任何操作之前就已固定。有人曾记录Claude Code的实际发送内容,每次请求包含约33000个系统提示和工具定义token,而较轻量的框架约为7000个。

将其乘以整个工程部门,宏观数字就说得通了。自2023年以来,每token价格下降了超过90%,但自2025年底以来,LLM总支出仍然翻了一番。经济学家称之为杰文斯悖论:当某样东西变得更便宜时,人们会使用更多。一个智能体使用20倍的token而价格打75折,最终账单仍是原来的5倍。

Anthropic自己的文档也显示了同样的情况。今年4月,它将Claude Code的成本指导从每开发者每活跃日6美元翻倍至13美元,而价格并未改变,只是默认模型现在消耗更多token。

席位数许可模式失效

过去一年中的定价变化都指向同一个方向。Cursor在2025年6月将Pro重新定价为基于使用积分,随后不得不退还因此产生的意外账单。Anthropic一个月后对Claude Code重度用户增加了每周速率限制。今年,GitHub Copilot转向计量AI积分,Databricks Genie则实行按量付费,每个用户每月只有少量免费额度。

原因是开发者之间的差异。Cursor自己的数据显示,前1%的开发者生成的中位数代码行数是普通开发者的45倍。席位数许可模式平均分摊成本,这在智能体出现之前基本可行。但现在,一个热衷的工程师带着充满循环的框架就能消耗原来整个团队的用量。

Ethan Ding在2025年7月指出了这种挤压:需求集中在前沿模型上,智能体使每任务token数倍增,而固定订阅模式对卖家来说成为亏本买卖。一年后,这基本成为了现实。

16.5万美元的重写

这是促使我撰写本文的故事背景。本月初,现属Anthropic的Bun团队发布了将Bun JavaScript运行时从Zig重写为Rust的报告:535496行Zig代码,由一名工程师在11天内完成,同时监督约64个Claude智能体。披露的用量为59亿未缓存输入token和6.9亿输出token,“按API定价约16.5万美元”。

这是一次拉取请求花费16.5万美元,超过Anthropic自己每开发者13美元指导的10000天。如果这个数字作为软件开支项目出现在CFO的桌上,就会引发Uber和Tesla刚实施的那种限制。

Bun的创建者Jarred Sumner估计,人工重写需要“3名对代码库有全面了解的工程师大约一年时间”。Hacker News一位评论者算了薪资账:按湾区薪酬,这“仅人力成本就至少150万美元”,而且需要一年而非11天。与之相比,相同的16.5万美元大约打了9折,速度提升约30倍。

而且这并非演示:该移植在所有平台上100%通过了Bun的测试套件后合并,Claude Code自6月中旬起已运行在Rust版本上,Simon Willison通过查找嵌入在发布二进制文件中的Rust源文件名验证了此事。这笔账单是离谱还是划算,完全取决于你将其放在哪个预算科目下。

数字变得模糊的部分

这种对比承载了很多内容,因此需要质疑。首先是价格本身。16.5万美元是“API定价”,但Anthropic并不为自己使用的token支付API价格。而且API价格是否反映成本也不清楚。SemiAnalysis估计Anthropic的推理利润率从38%上升到70%,因此token的售价很可能高于服务成本,只是训练和其他开支使实验室整体亏损。

Hacker News上的人们进行了双向计算。如果实验室以亏损价提供推理,那么真实数字可能是30万或50万美元。另有人算出,如果用消费者订阅购买相同token,成本约为2.56万美元。美元数字因谁在框架内而相差20倍。

然后是钱买到了什么。Zig的创建者Andrew Kelley审视结果后问道,一个未能捕获Zig代码错误的测试套件,为何能“足够捕获100万行未经审查的垃圾代码中的错误”。该移植包含约13000个unsafe关键字,并带着19个已知回归问题发布(均已修复)。对比中还将Sumner本人11天的协调和审查视为免费。验证环节通常是AI节省泄漏的地方。METR在2025年初的随机研究发现,经验丰富的开发者使用AI工具后速度慢19%,却相信快20%,尽管一年后的跟进研究将结果修正为小幅提速但误差范围覆盖正反两个方向。

恐慌也主要存在于分布顶端。Tomasz Tunguz的数据显示,中位数软件公司每工程师每年的AI支出仅为137美元。大多数公司并没有失控的token问题。即使在Uber,抱怨的不是账单本身。当被问及开支是否产出已发布功能时,COO的回答是“这个关联还不存在”。

我不知道Bun重写的实际成本是多少。标价16.5万美元,真实成本可能三倍,订阅价格下则只是一小部分。这就是AI预算的真实状况:本文中的每个数字都取决于实验室在价格战期间设定的价格。甚至连token本身也不是稳定单位,Anthropic的新分词器对相同代码产生的token数量大约多出30%,因此有效价格上涨而标价未变。设置上限作为防范无法定价账单的护栏,在我看来是合理的。

但我认为稳定的部分是对比。Tunguz将推理视为工程师薪酬的第四部分。Sequoia认为AI代理争夺的是劳动力预算而非软件预算。两者指向同一件事:智能体支出像工资而非SaaS账单。Bun重写只有在如此看待时才显得便宜。即使本文中的每个数字在价格战结束后翻三倍,49.5万美元对比150万美元的薪酬仍然指向同一方向。

那些在冬季按token用量排名团队、在夏季设置上限的公司,尚未回答真正的问题:一项任务的价值是什么。在有人能真正将投入的token与产出的价值联系起来之前,我预计预算将继续从一个极端摆向另一个极端。