AI越来越贵,但缓解即将到来,不过不是为你
生成式AI应用和服务的成本不断攀升,新硬件承诺提高效率,但节省的成本不会传递给用户。模型开发商面临高额基础设施成本,而价格却在上涨。
生成式AI应用和服务的成本日益高昂,因为模型开发商正努力应对不断飙升的基础设施开销。虽然新一代GPU和AI加速器承诺降低推理需求带来的压力,但用户不会看到这些节省。
经过多年和数十亿美元的投资,大型AI公司正开始为这项技术寻找除了聊天机器人和图像生成器之外的实际用例。Claude Code、Codex、GitHub Copilot等代码助手已成为AI迄今为止最大的成功故事,但历史表明它们不会是最后一个。
然而,成功是一把双刃剑。用于训练这些模型的服务器群原本不是为了以这种规模提供服务而建造的。推理和训练是截然不同的。现在,销售AI热潮工具的公司正竞相推出更适合服务于这些模型的新硬件。英伟达(Nvidia)从其储备中拿出200亿美元收购AI芯片初创公司Groq正是为了这个原因。AMD、AWS、英特尔和谷歌等公司也正在重新设计他们的GPU和AI加速器,以降低每token的成本。
更便宜的token意味着更好的推理经济性、更高的利润率,风险资本家希望OpenAI、Anthropic等公司最终能扭亏为盈。
问题在于,所有这些AI优化硬件尚未准备就绪。大部分承诺今年下半年推出,但需要时间解决技术问题并提升供应链,因此这些新系统的大规模部署要到2027年初至年中。
这为模型开发商提供了一个转瞬即逝的机会,看看他们的产品有多令人上瘾,以及市场能承受多少。我们看到,随着GPT-5.5的推出,OpenAI将每百万token的价格提高了一倍。谷歌也紧随其后,其新推出的Gemini Flash 3.5价格是之前版本数倍。这些价格上涨还因为构建在这些模型之上的代理系统消耗token的速度比典型聊天机器人快几个数量级。
固定费率定价在大多数客户未触及使用上限时有意义,但当客户每月花费200美元购买价值5000美元的token时,就变得不合理。微软已经认识到这一点,放弃了GitHub Copilot的席位定价,转向基于使用量的定价。Anthropic也在重新考虑其定价模式,但并不是转向纯使用量计费,而是考虑淡化订阅功能。
那些认为AI可以用很少的钱取代全职员工的高管将面临现实。当Anthropic、谷歌或OpenAI可以收取每小时30美元的token费用,并声称这仍然比支付员工每小时40美元外加福利和失业保险便宜时,AI不会成为节省成本的灵丹妙药。未来,AI定价可能会以每全职等效成本($/FTE)而非每百万token来营销。
尽管如此,大型科技公司仍在为了追求AI而裁员数千人。本月,Meta裁减约10%的全球员工,关闭约6000个职位,并将约7000名员工重新分配到AI部门。Cloudflare裁减超过1100名员工,思科辞退约4000人,甚至新西兰也计划利用AI裁减约9000名政府工作人员。
竞争本应是高价的解药,但前提是有利润空间可削减。目前顶级模型开发商都深陷亏损。超大规模云提供商具有优势,他们可以在AI投资上亏损数年,同时依靠其他产品部门防止股东抗议。但总会有人需要构建模型。微软、Meta和AWS正在尝试模型训练,但尚未证明能在任何有意义的方式上与OpenAI或Anthropic竞争。谷歌在这方面脱颖而出,其Gemini模型经常与GPT和Claude一较高下。
如果历史有参考价值,AI繁荣和不可避免的萧条将遵循熟悉的轨迹:泡沫中竞争激烈,但一旦破裂,整合不可避免。