AI News HubLIVE
站內改寫4 分鐘閱讀

AI支出現被視為勞動力成本

公司對AI工具的成本控制日益嚴格,但將AI支出與勞動力成本對比時,其價值可能被重新評估。本文透過分析Uber、Tesla的預算限制以及Bun重寫的案例,探討了AI支出應如何歸類。

來源Hacker News AI作者: konmam

上個月,我在關於Fable 5的文章結尾提到,越來越多企業開始審視自己的AI成本。此後情況並未減緩,因此本文深入探討這一趨勢。

一年前,企業還鼓勵工程師大量使用AI。Uber內部設有排行榜,按Claude Code使用量排序工程師,消耗更多token被視為積極訊號。但今年春天,同一批公司開始設定上限。Uber在四個月內用盡了2026年全年AI程式設計預算,現限制工程師每工具每月1500美元。Tesla從排行榜轉向每週200美元的上限。微軟則撤回了大部分內部Claude Code許可證,轉而推廣自家的Copilot。

這些故事背後的賬單是真實的,恐慌也有其道理。但我認為,目前的限制措施將AI支出對錯了預算科目。

賬單為何暴漲

理解資金去向的最好方式是關注單一任務而非整體賬單。當Uber的CTO內部演示智慧體程式設計時,一場兩小時的演示花費了1200美元,且一切順利。這僅僅是智慧體在規劃、讀取檔案、呼叫工具、審查輸出和重試時產生的正常成本,每輪都攜帶之前所有輪次的完整歷史。

部分成本在智慧體執行任何操作之前就已固定。有人曾記錄Claude Code的實際傳送內容,每次請求包含約33000個系統提示和工具定義token,而較輕量的框架約為7000個。

將其乘以整個工程部門,宏觀數字就說得通了。自2023年以來,每token價格下降了超過90%,但自2025年底以來,LLM總支出仍然翻了一番。經濟學家稱之為傑文斯悖論:當某樣東西變得更便宜時,人們會使用更多。一個智慧體使用20倍的token而價格打75折,最終賬單仍是原來的5倍。

Anthropic自己的文件也顯示了同樣的情況。今年4月,它將Claude Code的成本指導從每開發者每活躍日6美元翻倍至13美元,而價格並未改變,只是預設模型現在消耗更多token。

席位數許可模式失效

過去一年中的定價變化都指向同一個方向。Cursor在2025年6月將Pro重新定價為基於使用積分,隨後不得不退還因此產生的意外賬單。Anthropic一個月後對Claude Code重度使用者增加了每週速率限制。今年,GitHub Copilot轉向計量AI積分,Databricks Genie則實行按量付費,每個使用者每月只有少量免費額度。

原因是開發者之間的差異。Cursor自己的資料顯示,前1%的開發者生成的中位數程式碼行數是普通開發者的45倍。席位數許可模式平均分攤成本,這在智慧體出現之前基本可行。但現在,一個熱衷的工程師帶著充滿迴圈的框架就能消耗原來整個團隊的用量。

Ethan Ding在2025年7月指出了這種擠壓:需求集中在前沿模型上,智慧體使每任務token數倍增,而固定訂閱模式對賣家來說成為虧本買賣。一年後,這基本成為了現實。

16.5萬美元的重寫

這是促使我撰寫本文的故事背景。本月初,現屬Anthropic的Bun團隊釋出了將Bun JavaScript執行時從Zig重寫為Rust的報告:535496行Zig程式碼,由一名工程師在11天內完成,同時監督約64個Claude智慧體。披露的用量為59億未快取輸入token和6.9億輸出token,“按API定價約16.5萬美元”。

這是一次拉取請求花費16.5萬美元,超過Anthropic自己每開發者13美元指導的10000天。如果這個數字作為軟體開支專案出現在CFO的桌上,就會引發Uber和Tesla剛實施的那種限制。

Bun的建立者Jarred Sumner估計,人工重寫需要“3名對程式碼庫有全面瞭解的工程師大約一年時間”。Hacker News一位評論者算了薪資賬:按灣區薪酬,這“僅人力成本就至少150萬美元”,而且需要一年而非11天。與之相比,相同的16.5萬美元大約打了9折,速度提升約30倍。

而且這並非演示:該移植在所有平臺上100%透過了Bun的測試套件後合併,Claude Code自6月中旬起已執行在Rust版本上,Simon Willison透過查詢嵌入在釋出二進位制檔案中的Rust原始檔名驗證了此事。這筆賬單是離譜還是划算,完全取決於你將其放在哪個預算科目下。

數字變得模糊的部分

這種對比承載了很多內容,因此需要質疑。首先是價格本身。16.5萬美元是“API定價”,但Anthropic並不為自己使用的token支付API價格。而且API價格是否反映成本也不清楚。SemiAnalysis估計Anthropic的推理利潤率從38%上升到70%,因此token的售價很可能高於服務成本,只是訓練和其他開支使實驗室整體虧損。

Hacker News上的人們進行了雙向計算。如果實驗室以虧損價提供推理,那麼真實數字可能是30萬或50萬美元。另有人算出,如果用消費者訂閱購買相同token,成本約為2.56萬美元。美元數字因誰在框架內而相差20倍。

然後是錢買到了什麼。Zig的建立者Andrew Kelley審視結果後問道,一個未能捕獲Zig程式碼錯誤的測試套件,為何能“足夠捕獲100萬行未經審查的垃圾程式碼中的錯誤”。該移植包含約13000個unsafe關鍵字,並帶著19個已知迴歸問題釋出(均已修復)。對比中還將Sumner本人11天的協調和審查視為免費。驗證環節通常是AI節省洩漏的地方。METR在2025年初的隨機研究發現,經驗豐富的開發者使用AI工具後速度慢19%,卻相信快20%,儘管一年後的跟進研究將結果修正為小幅提速但誤差範圍覆蓋正反兩個方向。

恐慌也主要存在於分佈頂端。Tomasz Tunguz的資料顯示,中位數軟體公司每工程師每年的AI支出僅為137美元。大多數公司並沒有失控的token問題。即使在Uber,抱怨的不是賬單本身。當被問及開支是否產出已釋出功能時,COO的回答是“這個關聯還不存在”。

我不知道Bun重寫的實際成本是多少。標價16.5萬美元,真實成本可能三倍,訂閱價格下則只是一小部分。這就是AI預算的真實狀況:本文中的每個數字都取決於實驗室在價格戰期間設定的價格。甚至連token本身也不是穩定單位,Anthropic的新分詞器對相同程式碼產生的token數量大約多出30%,因此有效價格上漲而標價未變。設定上限作為防範無法定價賬單的護欄,在我看來是合理的。

但我認為穩定的部分是對比。Tunguz將推理視為工程師薪酬的第四部分。Sequoia認為AI代理爭奪的是勞動力預算而非軟體預算。兩者指向同一件事:智慧體支出像工資而非SaaS賬單。Bun重寫只有在如此看待時才顯得便宜。即使本文中的每個數字在價格戰結束後翻三倍,49.5萬美元對比150萬美元的薪酬仍然指向同一方向。

那些在冬季按token用量排名團隊、在夏季設定上限的公司,尚未回答真正的問題:一項任務的價值是什麼。在有人能真正將投入的token與產出的價值聯絡起來之前,我預計預算將繼續從一個極端擺向另一個極端。