AI News HubLIVE
サイト内リライト8 分で読了

AIの総所有コスト(AI TCO)| Cohere

エンタープライズAIが実験から必須へと移行する中、AIの総所有コスト(TCO)を理解することが重要になっています。この記事では、トークン価格設定、インフラの所有とレンタルのトレードオフ、効率的な導入によるコスト削減など、AIの可視および隠れたコストを分析します。調査によると、ほとんどの組織が予想外のコスト超過に直面しており、大規模にハードウェアを所有することで大幅な節約が可能です。

ソースCohere Blog

多くの業界の企業にとって、人工知能の利用は好奇心からくる実験から必要な支出へと移行しており、デジタルトランスフォーメーション戦略はAIの革新とともに成長しています。しかし、多くの企業はAIテクノロジーを購入する際の単位経済学を完全には理解しておらず、AIワークフローが野心的に拡大し、ビジネスを遂行する上で恒久的な部分となるにつれて、財務リスクに変わる可能性があります。

Cohereでは、AIの総所有コスト(TCO)に関連するお客様の課題と、AIテクノロジーをいつ所有し、いつレンタルするかに関する戦略的決定を認識しています。AIの所有権は一律ではありません。この投稿では、エンタープライズでAIを実行する際の請求対象コストと隠れたコストの両方、およびAI所有権戦略にどのようにアプローチするかについて説明します。

AIコストの計算方法

AIの目に見える価格は通常、トークンで見積もられます。トークンは、モデルが読み取り、生成するテキストの断片です。トークンは、すべてのプロンプト、応答、取得ドキュメント、エージェントステップ、ツールコール、ループ、リトライで発生します。しかし、トークン価格設定はコストの一部にすぎません。エンタープライズ内で効果的に実装された場合にAIの使用量が拡大する方法を考えると、最も目立ち、予測不可能な部分ではありますが。

より大きな問題は、ベンダーが百万トークンあたりいくら請求するかではなく、AIがビジネスの遂行方法の不可分な側面になった場合に、AIを所有、運用、保護、拡張するためのコストです。これが、AI所有権が組織にもたらす中核的な課題です。

AI TCOは使用量とともに上昇

現在、エンタープライズAIが主要なビジネス支出になるにつれて、総所有コストは増加しています。Gartnerは、世界のAI支出が2026年に2.52兆米ドルに達し、年間44%増加すると予測しており、主にインフラストラクチャが牽引しています。AI導入が増加するにつれて、推論、より長いコンテキストウィンドウ、より多くのエージェントステップ、検索の増加、速度への需要により、その重要性が増します。画面に表示される1つの回答は、一連のモデル呼び出し、ドキュメント検索、ツール呼び出し、検証ステップを表している可能性があり、これらのステップはインフラストラクチャやモデルの請求書に隠れているわけではありません。

AI所有権の階層:インフラのレンタルと所有

AIが標準的なビジネスコストになるにつれて、企業はトークン、レイテンシ、スループット、稼働率、データ制御、支出予測能力など、何を購入しているのかを理解する必要があります。企業、特に財務リーダーやAI変革イニシアチブに関与する人々は、どの変数がコストを促進し、どれが制御を確保するかに焦点を当てる必要があります。AIを収益性高く拡大する企業は、最も多くを費やす企業ではなく、どのAI機能を所有し、どれをレンタルするかを理解し、それらを区別する規律を構築する企業です。すべてをレンタルする企業は、コストが持続不可能になるか、制御が静かに失われるときに、最終的に同じ結論に達します。

AIの隠れたコスト

トークン経済学は明白な出発点です。なぜなら、AI支出が従来のソフトウェアとは異なる振る舞いをする理由を説明するからです。従来のクラウドコンピューティングでは、コストはサーバー、ストレージ、帯域幅、時間といったおなじみの単位にマッピングされます。AIは、より変動しやすい計算単位を導入します。

トークンは小さいですが、トークン上に構築されたシステムは小さくありません。単一のユーザー要求は、長いプロンプト、大きなコンテキストウィンドウ、複数の推論ステップ、いくつかのツール呼び出し、洗練された最終回答を引き起こす可能性があります。ユーザーは1つのインタラクションを体験しますが、企業はチェーン全体に対して支払います。

これが、目に見える製品変更なしにAIコストが急騰する理由です。チームは、より良い回答を得るためにコンテキストウィンドウを拡大したり、幻覚を減らすために検索を追加したり、複雑なタスクのためにエージェントループを導入したり、リクエストをより大きなモデルにルーティングしたりする可能性があり、これらすべての賢明な決定が組み合わさって、コストプロファイルを劇的に変化させます。

AIシステム全体の検討

よくある間違いは、トークン価格を単位経済学と見なすことです。そうではありません。総所有コストは、トークンを生成するシステムです。関連する質問はより広範です。タスクはいくつのトークンを消費するか?ユーザーアクションの背後にいくつのモデル呼び出しがあるか?各ステップはどのモデルが処理し、どのようにルーティングされるか?どのくらいのコンテキストが渡されるか?システムはどのくらいの頻度でリトライするか?ビジネスに必要なレイテンシは?支払われたインフラは実際に利用されているか?

これの多くはインフラストラクチャによって推進されますが、企業が競争力を維持するためにデジタルイノベーションの最先端にいなければならないという命令によっても推進されます。そのため、企業は市販されているイノベーションの最前線にある最大のモデルを消費する傾向があります。例えば、Uberの決算説明会では、「同社のコミットコードの10%は自律エージェントによって構築されている」と述べられており、これは同社がAI予算の12か月分をわずか4か月で費やした時期と一致しています。

見出しがあふれましたが、疑問は残りました。AIはより生産的な組織を生み出しましたが、収益予測に関心のあるリーダーにとって、イノベーションは不正確な予測を犠牲にしてはなりません。

市場ですでに見える驚き

最近の調査は、予想外のAIインフラコストの規模を浮き彫りにしています。DataRobotが委託した2025年12月のIDC InfoBriefによると、生成AIを展開している組織の96%、エージェンティックAIを使用している組織の92%が予想以上のコストに直面しました。これらの広範囲にわたる超過は、現在の計画モデルが実際のワークロードと一致していないことを示しています。Gartnerは、AIが「幻滅の谷」に入ると予想しており、拡大の主な障壁は野心の欠如ではなく、リターンの予測不可能性です。

2025年11月のMcKinsey調査では、105か国の約2,000の組織を対象に、AI導入は広く行われているものの、エンタープライズ全体で拡大しているのは約3分の1に過ぎず、有意な財務影響を報告しているのはわずか5~6%であることがわかりました。教訓は明確です。明確な価値のない予測不可能な支出は、不十分なコスト管理を罰します。

予測とガバナンスは依然として課題です。MavvrikとBenchmarkitによる2025年の調査では、企業の80%がAIインフラ予測を25%以上外し、ほぼ25%が50%以上外していることがわかりました。実際の支出の10%以内に収まっているのはわずか15%です。さらに、企業の84%がAIインフラストラクチャにより売上総利益率が6%以上低下したと報告しています。ソフトウェア企業にとって、これらは裁量的な革新支出ではなく、継続的なコストです。重要な結論は、可視性が限られているためAIコストの管理が困難であり、社内AI費用を報告している企業は約3分の1にすぎないということです。

コストに関するその他の考慮事項

コストだけが懸念事項ではありません。政府がAIガバナンスと基準を強化するにつれて、外部所有のモデルに依存すると、アクセス、条件、可用性に関するリスクが生じます。実際的な問題は、企業の管理下にないモデルは事実上レンタルされた機能であるということです。

現在、AIコストは従来のテクノロジー費用よりも急速に増加し、後から発生することが多く、予測可能なパターンに従いません。エージェントオーケストレーションやプロンプトの小さな変更が、トークン消費を大幅に増加させる可能性があります。帰属または管理できないコストは完全に制御できません。

AIの資本コストと運用コスト

AIシステムに投資する際には、資本と運用の2つの異なるコストを考慮する必要があります。資本支出は、チップ、サーバー、ストレージ、ネットワーキング機器など、企業が所有する資産を対象とします。これらの投資は多くの場合物理的であり、多額の初期費用と時間の経過による減価償却が伴います。運用支出には、クラウドインスタンス、トークン、電力、冷却、床面積などのレンタルまたは従量制リソースが含まれます。これらの運用費は開始は簡単ですが、規模が大きくなると重要になります。

両方のカテゴリにわたる主要なコストドライバーは、スループット(1秒あたりのトークン数)、単価(100万トークンあたりのコスト)、応答性(最初のトークンまでの時間)、そして最も重要な稼働率です。稼働率は、所有とレンタルのどちらがより費用対効果が高いかを決定する主要な要因です。

効率的な導入によるAIコストの削減

ハードウェアは最大容量を決定しますが、モデル効率が実際のパフォーマンスを左右するため、コスト予測の重要な変数となります。Cohereモデルはパラメータと量子化の点でさまざまですが、トークンをモデルパラメータのサブセットにルーティングする方法(Mixture-of-Experts、MoE)により、大幅な機能喪失なしに生成コストを削減できます。さらに、低ビット量子化モデルはスループットを向上させ、レイテンシを削減し、ハードウェアの出力を最大化できます。

これらの理由から、モデルルーティング、つまり特定のタスクに適したサイズのモデルを選択することは、モデル推論のコストを削減するために重要です。これらの技術は、所有ハードウェアで費用対効果の高いパフォーマンスを達成するために不可欠です。

これこそ、ハードウェアの価格だけではコストの適切なガイドにはならない理由です。NVIDIA(そのチップが世界の推論の多くを処理している)は、重要な指標は計算コストや1ドルあたりの理論上の演算数(支払うものを測定する)でも、トークンあたりのコスト(実際に生産するものを測定する)でもないと主張しています。同社によると、1秒あたりのトークン数が少ない安価なGPUは、結局トークンあたりのコストが高くなり、安くなりません。世代間の利得は大きく、NVIDIAはBlackwellクラスのシステムが以前のHopper世代と比較してメガワットあたり約50倍のトークンを生成し、トークンあたりのコストを約35分の1に削減すると報告しています。

トレードオフを具体的にするために、継続的に実行されるカスタマーサポートアシスタントを想像してみてください。1日50万件のリクエスト、それぞれ数千トークン、各回答の背後にある検索とリトライを含みます。フロンティアAPIを介してレンタルした場合、使用量とコストは決して止まりません。所有ハードウェアで同じワークロードを実行すると、コスト構造が逆転します。ハードウェアは固定の減価償却費となり、その後は追加リクエストごとにほぼ無料になります。一定量を下回ると、アイドルハードウェアは純粋な無駄であるためAPIが勝ります。それを超えると、所有が先行し、トークンごとに差が広がります。

データセンター規模では、その差は具体的な数字に現れます。2026年のLenovo分析は、70~405Bパラメータモデルを処理する自社の8-GPUサーバーで実行され、所有H100ハードウェアで100万トークンを生成する償却コストは約0.11ドル、同等のクラウドインスタンスでは約0.89ドル、同等のフロンティアAPIでは約2.00ドルと試算されました。

所有推論は、2つの異なる方法で約0.11~0.12ドルに着地しました(Lenovoの5年間所有TCO、NVIDIA/SemiAnalysis InferenceXベンチマークによる新しいGB300チップ、厳密には比較できません)。レンタル数値はLenovoから。所有数値は持続的な高稼働率を前提としています。

これは、レンタルクラウドインフラストラクチャに対して8倍、APIによるトークン購入に対して最大18倍の優位性であり、継続使用の場合、サーバーあたり数百万ドルの5年間節約になります。同じ分析では、8-GPUサーバーは4か月以内に元が取れることがわかりました。ただし、これは最も高価なレンタル方法であるオンデマンドクラウド価格に対してのみです。

2つの独立した推定値は、異なる方法で到達しましたが、所有推論を同じ範囲に置いています。Lenovoの約0.11ドルはH100の5年間所有モデルによるものです。NVIDIAは、サードパーティのSemiAnalysis InferenceXベンチマークで測定された、主力GB300プラットフォームで100万トークンあたり0.123ドルを報告しています。これらの数字は厳密には比較できません(1つは会計上の償却、もう1つは新しいチップの推論ベンチマーク)が、2つのソースが自己ホスト出力で約0.11~0.12ドル、クラウドインスタンスで約0.89ドル、フロンティアAPIで約2.00ドルと着地していることは、どちらか一方の数字だけよりも堅固な根拠となります。

これらの数字には2つの条件があります。これらはベンダーコストであり、そのベンダーのハードウェアで計算されており、クラウド側はストレージ、エグレス、サポートコストを意図的に省略しています。