1つのGPUに何人の開発者が収まるか?
本記事では、AIコーディングエージェント向けのGPUセルフホスティングのコストとトレードオフを探る。トークンコストの高騰により、多くの組織がGPUの自家運用を検討している。使用パターン、ハードウェアオプション(DGX Sparkから8×B200まで)、並行ユーザー数がタスク完了時間に与える影響を分析し、意思決定の枠組みを提供する。
今年上半期、AIコーディングエージェントのトークンコストが大きな注目を集めました。GitHub Copilotがトークンベースの課金に移行し、Uberは年間AIツール予算をわずか4か月で使い切り、開発者の月額コストは$29から$750に跳ね上がりました。これらの現象は「tokenmaxxing」や「token panic」といった新語を生み出しました。
現在、平均的な従業員はAI APIの使用に年間約$140を費やしていますが、裾野は広がっています。90パーセンタイルユーザーは年間約$7,300、99パーセンタイルは約$90,000に達します。エージェント型AIの普及に伴い、これらの数字は今後さらに上昇すると予想されます。
コスト変動の主な原因はAIエージェントの使用方法にあります。主要モデルプロバイダーのARRの70%以上がコーディング用途から来ています。ワークフローをエージェントに委ねるほど、トークン請求額は増加します。多くの組織はOpenAIやAnthropicなどのAPIを通じてAIコーディングエージェントを導入し始めますが、数か月後にはトークン価格モデルの高騰、より高価なモデルへのアップグレード、エージェント採用の急増により、代替案を検討し始めます。APIルーター、安価なモデル階層、さらには独自の推論スタックの構築などが選択肢となります。
GPUのセルフホスティングには慎重な検討が必要です。トークンごとに課金されるAPIとは異なり、セルフホスティングは24時間365日、インフラストラクチャのコストを支払うことになります。トークンを生成していないときでも料金が発生します。このトレードオフが機能するかどうかは、2つの質問で決まります。プールのどれだけを使用しているか?そして、そのプールを何人の開発者で共有できるか?
実際の需要は一定ではなく、スパイク状です。コーディングタスクのトークン使用は夜間にほぼゼロになり、朝方に増加し、昼食時に低下し、午後遅くに再びピークに達します。つまり、ピーク負荷に合わせてハードウェアを購入し、24時間支払うことになります。エンタープライズ推論ワークロードの平均GPU稼働率は15-22%で、適切に運用された場合でも35%を超えることはほとんどありません。ただし、自動化エージェント(スケジュールされたジョブや午前3時のバグレポート処理など)が増えることで、この状況は改善される可能性があります。
APIから移行する際の主な懸念事項は開発者体験です。評価基準は1秒あたりのトークン数ではなく、タスクの完了時間であるべきです。この記事では、SWEBench Proのコーディングタスクを使用して、異なるハードウェアとモデルの組み合わせが同時ユーザー数の増加に伴ってどのようにパフォーマンスを発揮するかを測定します。
記事では4つのハードウェアオプションを紹介しています。NVIDIA DGX Spark(Qwen3.6-35B-A3Bを実行可能)、単一のH200、4×H200(DeepSeek-V4-Flashを実行可能)、8×B200(GLM-5.2を実行可能)です。初期テストでは、DGX Sparkは最大1-2の同時ユーザーしか処理できませんが、大規模な構成ではより高い並行処理が可能です。
今後のセクションでは、テスト結果を詳しく掘り下げ、GPUを購入するかレンタルするか、APIを使い続けるかを組織が決定するためのコスト分析を提供します。