一塊GPU能容納多少開發者?
本文探討了自建AI編碼代理推理基礎設施的成本與權衡。由於API token消耗激增,許多組織開始考慮自託管GPU。文章分析了token使用模式、硬件選項(從DGX Spark到8×B200)以及併發用户對任務完成時間的影響,提供了決策參考。
今年上半年,AI編碼代理的token成本問題引起了廣泛關注。GitHub Copilot轉向基於token的計費,Uber在四個月內耗盡了年度AI工具預算,開發者報告月成本從$29飆升至$750。這些現象催生了“tokenmaxxing”、“token panic”等新詞。
目前,普通員工每年在AI API上的花費約為$140,但尾部效應顯著:90百分位用户年花費約$7,300,99百分位接近$90,000。隨着代理式AI的普及,這些數字預計將繼續攀升。
成本波動的主因是AI代理的使用方式:超過70%的模型提供商ARR來自編碼場景。當組織將更多工作流交給代理時,token賬單隨之增長。許多組織最初通過OpenAI或Anthropic等前沿模型提供商的API開始採用AI編碼代理,但幾個月後,由於token定價模式變貴、用户升級更貴模型以及代理採用率激增,他們開始考慮替代方案,包括API路由器、更便宜的模型層級,甚至自建推理基礎設施。
自託管GPU需要仔細權衡。與按token計費的API不同,自託管意味着為底層基礎設施支付24/7的費用,即使沒有產生token也得付費。這取決於兩個關鍵問題:你用了多少資源?以及能同時服務多少開發者?
實際需求並非恆定,而是具有波動性。編碼任務的token使用通常在夜間接近零,上午攀升,午餐時下降,下午再次達到高峯。這意味着你需要為峯值負載購買硬件,但得全天候付費。企業推理工作負載的平均GPU利用率僅為15-22%,即使優化良好的部署也很少超過35%。不過,隨着自動化代理(如調度任務、凌晨3點自動處理bug報告)的增加,這種模式可能有所改善。
從API轉向自託管時,開發者體驗是主要關注點。評估標準不應是每秒token數,而是任務成功完成的時間。文章引入SWEBench Pro中的編碼任務來衡量不同硬件和模型組合在併發用户增加時的性能。
文章介紹了四種硬件選項:NVIDIA DGX Spark(可運行Qwen3.6-35B-A3B)、單塊H200、4×H200(可運行DeepSeek-V4-Flash)以及8×B200(可運行GLM-5.2)。初步測試顯示,DGX Spark最多支持1-2個併發用户,而更大配置能處理更高併發。
後續部分將深入測試結果並進行成本分析,幫助組織決定是購買GPU、租賃,還是繼續使用API。