AI News HubLIVE
站內改寫2 分鐘閱讀

像穴居人一樣對AI智能體説話真的能節省65%的Token嗎?我們測試了

JetBrains測試了Claude Code的'穴居人'技能,該技能聲稱通過讓智能體説話簡潔節省65%的Token。在82個真實智能體任務的配對A/B基準測試中,強制激活時實際節省僅約8.5%。未發現明顯的質量下降。廣告中的節省適用於聊天風格,而非智能體工具調用。該技能安全有趣,但被過度宣傳。

來源Hacker News AI作者: Sandman

JetBrains 對一種名為“穴居人”(Caveman)的 AI 智能體技能進行了嚴格的配對 A/B 測試,該技能聲稱可以讓 AI 智能體像穴居人一樣説話,從而節省高達 65% 的 Token。然而,測試結果表明,實際節省遠低於宣傳數字,但該技能並未對任務質量造成可測量的損害。

測試環境使用了 JetBrains 的 HarnessHarbor 0.17 沙箱,智能體為 Claude Code 2.1.200,模型為 claude-sonnet-5(低推理努力度)。基準測試採用 SkillsBench 中的 86 個任務,每個任務均通過自動測試評分(0-1 分)。實驗分為兩組:A 組為未啓用技能的 Claude Code,B 組強制啓用“穴居人”技能。共進行了 3 輪測試,約 240 個計費試驗,總花費約 106 美元。

發現一:Token 節省約為 8.5%,而非 65%

宣傳中的 65% 節省源自聊天風格的散文回答。但智能體的輸出主要是代碼、差異、工具調用和錯誤字符串,這些部分“穴居人”技能會原樣保留。它只壓縮工具調用之間的敍述性內容,而這部分佔比很小。在強制啓用的情況下,輸出 Token 節省收斂至 8.5%(從 592k 降至 542k),遠低於廣告中的 65%。

發現二:未檢測到質量下降

在全部 82 個配對任務中,兩組的表現統計上無法區分。符號檢驗 p 值為 0.82,遠未達到顯著水平。平均任務得分:基準組 0.326,技能組 0.311,僅差 0.015 分。技能成功實現了風格轉換,使智能體的對話變得像穴居人,但代碼工件保持不變。

發現三:成本節省真實但脆弱

成本節省大致與 Token 節省一致,約 10%。但在完整運行中,技能組反而貴了 11.6%(40.60 美元 vs 36.39 美元),這完全歸因於一個離羣任務:一個依賴審計任務因進入長上下文定價區間而在技能組產生了 8.29 美元的費用,而基準組僅 0.33 美元。這表明成本節省容易被單次試驗的變異所抵消。

結論

“穴居人”技能安全、誠實改變了風格,但在節省方面被過度宣傳。強制啓用時,它可靠地改變智能體的説話方式,而不會對任務結果造成可測量的損害。但在真實的智能體工作中,它最多隻能削減約 8.5% 的輸出 Token 和約 10% 的成本,因為佔據主導的 Token 是代碼和工具調用,而這些是技能刻意保留的。廣告中的 65% 屬於聊天式問答,而非編碼智能體。建議:如果喜歡這種風格,可以用它,因為它有趣且不會降低質量。但不要指望在日常智能體任務中節省大量 Token,高個位數的百分比才是現實的上限。