AI News HubLIVE
站内改写5 分钟阅读

AI总拥有成本(AI TCO)| Cohere

随着企业AI从实验转向必要支出,理解AI总拥有成本(TCO)变得至关重要。本文分析了AI的显性和隐性成本,包括令牌定价、基础设施拥有与租赁的权衡,以及如何通过高效部署降低费用。研究表明,大多数组织面临意外成本超支,而自主拥有硬件在规模下可显著节省成本。

对于许多跨行业企业而言,人工智能的使用已从好奇实验转变为必要支出,其数字化转型战略与AI创新同步发展。然而,许多公司仍然没有完全理解购买AI技术时的单位经济学,这可能在AI工作流规模扩大并成为业务永久部分时转化为财务风险。

在Cohere,我们认识到客户在AI总拥有成本(TCO)以及何时拥有AI技术、何时租赁方面的战略决策挑战——AI所有权并非一刀切。本文将介绍企业中运行AI的显性和隐性成本,以及如何制定AI所有权策略。

AI成本如何计算

AI的可见价格通常以令牌报价。令牌是模型读取和生成的文本片段。每个提示、响应、检索文档、代理步骤、工具调用、循环和重试都会产生令牌。然而,令牌定价只是成本的一部分——尽管在AI有效实施并扩展时,它是最显眼且最不可预测的部分。

更大的问题不在于供应商每百万令牌的收费,而在于拥有、运营、保护并扩展AI的成本,一旦AI成为业务不可或缺的部分。这是AI所有权给组织带来的核心挑战。

AI TCO随使用量上升

如今,随着企业AI成为主要业务支出,总拥有成本正在增加。Gartner预测全球AI支出将在2026年达到2.52万亿美元,年增长44%,主要由基础设施驱动。随着AI采用率提高,推理、更长的上下文窗口、更多代理步骤、检索增加和速度需求,成本影响更大。屏幕上的一个答案可能代表一系列模型调用、文档搜索、工具调用和验证步骤——这些步骤并非隐藏在基础设施或模型发票中。

AI所有权层次:租赁与拥有基础设施

随着AI成为标准业务成本,公司必须理解他们购买的内容:令牌、延迟、吞吐量、利用率、数据控制以及预测支出的能力。企业,特别是财务领导和AI转型项目负责人,必须关注哪些变量驱动成本,哪些确保控制。能够盈利扩展AI的公司不是那些花费最多的,而是那些弄清楚哪些AI能力应该拥有、哪些应该租赁,并建立区分它们的纪律的公司。那些全部租赁的公司最终会得出相同结论:当成本增长到不可持续或控制权悄然流失时。

AI的隐性成本

令牌经济学是明显的起点,因为它解释了为什么AI支出与传统软件不同。在传统云计算中,成本映射到熟悉的单位:服务器、存储、带宽和时间。AI引入了更不稳定的计算单位。

一个令牌很小,但建立在令牌之上的系统并不小。单个用户请求可能触发长提示、大上下文窗口、多个推理步骤、几个工具调用和精炼的最终答案。用户体验一次交互,公司为整个链条付费。

这就是为什么AI成本可能在没有可见产品变化的情况下飙升。团队可能扩展上下文窗口以获得更好的答案,添加检索以减少幻觉,引入代理循环处理复杂任务,或将请求路由到更大的模型——所有这些明智的决定,组合起来会显著改变成本概况。

审视整个AI系统

常见错误是将令牌价格视为单位经济学。事实并非如此。总拥有成本是产生令牌的系统。相关的问题更广泛:一个任务消耗多少令牌?用户操作背后有多少模型调用?每个步骤由哪个模型处理,如何路由?传递了多少上下文?系统重试的频率?业务需要什么延迟?支付的基础设施是否真的被利用?

这很大程度上由基础设施驱动,但也源于公司必须站在数字创新前沿以保持竞争力的紧迫性。因此,公司倾向于消费最大、最前沿的商用模型。例如,Uber的一次财报电话会议提到“公司10%的提交代码由自主代理构建”,这恰逢该公司在四个月内花掉了12个月的AI预算。

头条新闻层出不穷,但问题依然存在:AI创造了更高生产率,但对于关心收入预测的领导者来说,创新不能以预测不准确为代价。

市场已显现意外成本

最近的研究凸显了AI基础设施意外成本的规模。根据DataRobot委托的2025年12月IDC InfoBrief,96%部署生成式AI的组织和92%使用代理AI的组织面临高于预期的成本。这些普遍超支表明当前规划模型与实际工作负载不符。Gartner预测AI将进入“幻灭低谷”,扩展的主要障碍是回报的不可预测性,而非缺乏雄心。

2025年11月McKinsey对105个国家近2000家组织的调查发现,虽然AI采用广泛,但只有约三分之一的企业级规模部署,仅5-6%报告显著财务影响。教训明确:不可预测的支出,没有明确价值,惩罚了糟糕的成本管理。

预测和治理仍然具有挑战性。Mavvrik和Benchmarkit的2025年调查显示,80%的公司AI基础设施预测偏差超过25%,近25%偏差超过50%。只有15%的支出在10%以内。此外,84%的公司报告AI基础设施导致毛利率下降6%或更多。对于软件公司,这些是经常性成本,而非自由支配的创新支出。关键结论是有限的可见性使AI成本难以管理,因为只有约三分之一的公司报告本地AI支出。

更多成本相关考虑

成本并非唯一担忧。随着政府加强AI治理和标准,依赖外部拥有模型带来了访问、条款和可用性风险。实际问题是不受公司控制的模型实际上是一种租赁能力。

目前,AI成本增长速度快于传统技术支出,常常出现较晚,且不遵循可预测模式。代理编排或提示的微小变化可能显著增加令牌消耗。无法归属或管理的成本无法完全控制。

AI的资本和运营成本

投资AI系统需要考虑两种不同成本:资本和运营。资本支出涵盖公司拥有的资产,如芯片、服务器、存储和网络设备。这些投资通常是物理的,有大量前期成本和随时间折旧。运营支出包括租赁或计量的资源,如云实例、令牌、电力、冷却和场地空间。虽然这些运营支出更容易启动,但在规模下变得显著。

跨越两类的主要成本驱动因素是:吞吐量(每秒令牌数)、单价(每百万令牌成本)、响应性(到第一个令牌的时间),以及最重要的利用率。利用率是决定拥有还是租赁更具成本效益的主要因素。

通过高效部署降低AI成本

硬件决定最大容量,但模型效率决定实际性能,因此是预测成本的关键变量。Cohere模型在参数和量化方面各有不同,但通过混合专家(MoE)方法将令牌路由到模型参数的子集,可以降低生成成本而无需显著能力损失。此外,低位量化模型可以提高吞吐量并降低延迟,最大化硬件输出。

因此,模型路由,或者为特定任务选择合适大小的模型,对于降低模型推理成本至关重要。这些技术对于在自有硬件上实现成本效益性能至关重要。

这就是为什么仅硬件价格本身也是成本的不良指南。NVIDIA(其芯片处理了全球大部分推理工作)认为,重要的指标不是计算成本或理论每美元操作数(衡量你支付的),也不是每令牌成本(衡量你实际产生的)。据其自身统计,一个更便宜的GPU如果每秒产生更少的令牌,最终每令牌成本更高,而不是更低。代际收益很大:NVIDIA报告其Blackwell级系统每兆瓦产生的令牌比上一代Hopper系列大约多50倍,每令牌成本降低约35倍。

为了具体说明权衡,想象一个持续运行的客户支持助手:每天50万次请求,每次几千个令牌,包括每个答案背后的检索和重试。通过前沿API租赁,使用量和成本永远不会停止。在自有硬件上运行相同的工作负载,成本结构反转。硬件成为固定折旧费用,之后的每个额外请求几乎免费。低于一定数量,API胜出,因为空闲硬件是纯粹浪费;高于该数量,所有权领先,差距随着每个令牌扩大。

在数据中心规模上,差距以具体数字体现。2026年Lenovo分析在其自己的8-GPU服务器上运行70-405B参数模型(比上述单个示例更大的规模),将自有H100硬件上生成百万令牌的摊销成本定为约0.11美元,而等效云实例约为0.89美元,类似前沿API约2.00美元。

自有推理通过两种不同方法落在约0.11-0.12美元(Lenovo五年拥有TCO;NVIDIA/SemiAnalysis InferenceX基准测试在更新GB300芯片上,不完全可比)。租赁数据来自Lenovo。自有数字假设持续高利用率。

这比租赁云基础设施有八倍优势,比通过API购买令牌高达十八倍,持续使用下五年节省每台服务器数百万美元。同一分析发现,8-GPU服务器在四个月内收回成本——但仅针对按需云定价,最昂贵的租赁方式。

两个独立估计(通过不同方法)将自有推理落在同一范围。Lenovo的约0.11美元来自H100的五年拥有模型;NVIDIA报告其旗舰GB300平台每百万令牌0.123美元,由第三方SemiAnalysis InferenceX基准测量。这些数字并非严格可比——一个是会计摊销,另一个是更新芯片上的推理基准——但两个来源均落在约0.11-0.12美元的自有推理成本,而云实例约0.89美元,前沿API约2.00美元,比单独任何一个数字提供了更坚实的基础。

这些数字有两个条件。它们是供应商成本,基于该供应商硬件计算,并且云方面故意省略了存储、出口和支持成本。