AI News HubLIVE
站内改写4 分钟阅读

廉价AI的终结:消费定价对组织意味着什么

Anthropic及其他AI供应商正转向按使用量计费,取代以往的固定费用包干模式。这一变化源于算力成本上升、硬件供应紧张等因素。组织需要建立成本监控、工作负载路由和预算管理机制,以在工程师实验自由与成本控制间取得平衡。

来源Hacker News AI作者: bzimbelman

本文是《超越编码助手》系列第三篇,该系列探讨企业级AI辅助软件工程。此前文章讨论了AI工具为何让某些团队变慢,下一篇将关注AI开发的质量-速度-成本三难困境。

2025年11月,Anthropic开始以新计费结构续约企业客户。原有的捆绑token企业席位——每月按座收费附带大量token,仅当大幅超出时才支付额外费用——正被淘汰。新方案中,座位费仅覆盖平台访问,所有token按标准API费率单独计费。《The Register》以“Anthropic从企业座位协议中剔除捆绑token”为题进行了报道。

这并非AI公司行为不当的故事,而是技术成熟曲线的正常演进。每个主要技术类别都经历过类似阶段:供应商在培育需求时提供廉价接入,随后当需求赶上产能时进行价格修正。云计算如此,SaaS如此,现在是AI。

对工程组织的影响巨大,调整时机已到。2026年4月Axios报道,一些公司在AI上的支出已超过员工薪资——IT预算“被冲垮”。无论这种跨越是否已在某组织发生,趋势线清晰:随着AI使用成本上升至实际覆盖供应商算力支出,每家公司都必须选择如何为员工配置这些工具。明智的公司会找到方法,让工程师获得足够资源以提高生产力,同时避免无限资源导致浪费。这种平衡需要监控、归因和成本效益追踪能力——多数团队尚未具备。

补贴时代的短暂存在

固定费率的AI曾经存在,原因与2014年云计算折扣额度类似:供应商在产能未充分利用、市场争夺激烈时用利润换取采用率。这是当时的理性策略,无人幻想其永久持续。

多重力量加速了这一终结。

四重力量同时作用

消费定价:捆绑token安排正被行业范围内解除。Anthropic的转型最为明显,但并非孤例。座位费现在仅涵盖访问权限,使用量按标准费率按token计费。这意味着每个token都是成本,无法再隐藏在固定费用内。

产能限制:推理基础设施增长不及需求。产能紧张时价格成为配给机制。这非任何单一供应商的利润策略,而是物理和供应链问题。

实际输入成本:AI API定价背后的成本堆栈在多个方面恶化:

  • 电力:2025年美国居民电价上涨11.5%,是通胀率的三倍多。高盛和EIA预计2030年电价较2025年上涨40%。数据中心占美国电力需求增长的40-50%,某些数据中心附近批发电价较五年前上涨267%。
  • 内存:高带宽内存(HBM)结构性短缺。SK海力士先进封装线已排至2026年;美光HBM产能在2025年初即售罄。1GB HBM约消耗标准DRAM四倍的晶圆容量。DRAM价格在2026年Q1较2025年Q4上涨约90%。AI推高所有内存成本。
  • 硬件:即使消费端也感受到压力。2026年初,苹果Mac Mini因本地推理代理栈“OpenClaw”走红而缺货——表明“自己运行”需求可迅速压倒供应。

云与边缘推理差距:在本地或边缘硬件上运行推理,对于可预测工作负载可比云API调用便宜得多。Brad DeLong以Marco Arment的50台Mac Mini服务器农场为例:前期硬件约3万美元,每年摊销约6000美元,功率小于2千瓦,而相同工作负载若使用OpenAI Whisper API,每台Mac Mini等效日费约1800美元。另有分析显示,通过堆叠硬件、量化和蒸馏技术,可预测推理工作负载可实现约3000倍的效率与成本改善。方向明确:并非所有推理都需调用前沿模型API。

供应商锁定风险:深度依赖单一供应商意味着其定价变化直接成为你的定价变化,且无议价能力。这一风险在2026年4月比三年前更为突出。

一个实例

假设一个“AI PR浪潮”式设置——团队运行大规模并行AI代码生成,类似Gas Town。12至30个并发代理,每个承担小任务,生成并迭代多份草稿。早期Gas Town采用者公开提及API支出达每小时100美元。

在捆绑token定价下,只要该团队不是计划中最高用量者,每小时100美元通常被企业津贴覆盖。在按token定价下则不然。每小时100美元乘以正常工作周,仅生成步骤每年每团队就达数十万美元——还不包括验证、审查、测试或部署。新旧计费间的数量级差异并非意外,而是预期情况。

组织对此变化感到恐慌毫不意外。许多组织已在第一季度花完全年预算。预计成本将继续攀升。最大问题之一是缺乏有价值的报告和成本管理工具。因此,下一步需要的是管理成本的方法,以便组织能够自信地制定预算。

云成本类比

行业曾见过这一幕。2010年代末的云成本危机由相同模式产生:廉价丰富的新能力→工程师临时采用→六位数月账单无人预算→整个FinOps学科应运而生以建立防护栏。

这些教训直接适用于AI支出:

  • 按工作负载归因成本:若无法知晓特定PR、工作项或工作流的成本,就无法优化。粒度可观察性将ROI从感觉变为可衡量。
  • 以适当粒度设定预算:组织、团队、项目和工作项预算,并规定预算接近时如何应对。
  • 给予团队可见性:隐藏成本总是错配。团队只有在成本实时可见时才能做出成本意识决策,而非三周后在财务报告中。
  • 设计昂贵与廉价选项间的路由:并非所有任务都需要前沿模型,并非所有工作负载都需要云API调用。编排层应能切换模型,并随时间推移自主判断模型适用性。
  • 避免锁定:编排层需跨多个供应商工作,支持云端或本地自托管模型。锁定客户在下次定价变化时无议价能力。
  • 资源池化:单开发者沙盒无法实现团队级成本控制。共享计算池配合排队和优先级,是组织在不扼杀工程师的情况下控制预算的实际方法。

2015年将云成本视为后话的工程组织,花了多年时间为那个选择买单。早期建立成本意识的组织如今拥有持久优势。AI支出正上演相同模式。

让工程师探索,但有意识地

我并非主张严格锁定资源以致工程师无法实验。实验是学习和成长的方式。将成本视为一等约束并非剥夺工程师AI访问权。每个工程组织需要给工程师空间探索工具能力,尝试不奏效的想法,培养AI辅助工作流的品味——这只能通过亲身实践获得。这不是浪费,而是团队学习新能力的途径。

正确的答案是带有意识的分配:每位工程师的“学习预算”,共享实验池,token使用可见性,回顾哪些有效哪些无效。错误不在于不给工程师访问权,而在于给予无限访问权却没有反馈循环,然后对账单感到惊讶。

管理良好的SDLC将吸收变化,临时团队则不能

具有严格SDLC的组织——定义的工作流、分阶段审查、工作项级别预算、跨passes复用工件——能适应消费定价而无需中断。他们已知道每项工作的目的和值得花费多少。将简单重构路由至廉价模型,将安全敏感变更路由至前沿模型,仅是另一项调度决策。

工程师随意使用工具的组织则会经历更艰难的着陆。成本螺旋上升,因为一切无法归因。质量波动,因为无有意识路由。账单到来,除了“大家都在用AI”外无法解释。这不是可持续答案。

纪律成为竞争优势。现在在编排层构建成本意识和SDLC结构的组织将优于其他——不仅因为即时节省,更因为纪律会复合。在成本压力下做出的每个架构决策往往比充裕环境下更可防御。

架构上受青睐的特性

能够做到五点的系统将拥有持久优势:

  1. 根据任务复杂度在模型间路由——廉价模型用于廉价工作,前沿模型仅当任务需要时。
  2. 按事项/故事追踪预算和成本。
  3. 缓存中间表示,避免今日重新生成昨日已验证的工件。
  4. 无需重写工作流即可切换供应商,包括在本地运行低成本模型。
  5. 预算紧张时推迟低优先级工作。

所有这些背后的模式相同:工具和流程赋予组织实际成本控制,同时保持每个工程师的灵活性以良好完成工作。在成本控制与灵活性间取得平衡的组织将成为这场转型的赢家。选择一边——要么限制工程师至无用,要么让支出失控——的组织将输给那些找到平衡点的。

下篇文章《AI开发的质量-速度-成本三难困境》将进一步探讨。