AI News HubLIVE
站內改寫2 分鐘閱讀

Coinbase轉向開源模型,AI開支減半同時令牌使用量增長

Coinbase通過更好的默認設置、路由和緩存策略,將AI支出幾乎減半,同時令牌使用量持續增長。他們默認使用開源權重模型如GLM 5.2和Kimi 2.7,優化緩存命中率,並保持上下文精簡。

來源Hacker News AI作者: smurda

Coinbase首席執行官Brian Armstrong近日在社交媒體上詳細介紹了公司如何在不增加AI支出的情況下支持令牌使用量的指數級增長。他分享了一系列策略,核心在於通過更好的默認設置、路由和緩存來實現成本優化。Armstrong強調,目標不是通過設置上限或發送警報來限制使用,而是通過建設更智能的基礎設施,使增長可持續。

首先,Armstrong指出默認設置的重要性。工程師可以選擇任何模型,但默認模型對成本影響巨大。Coinbase正在試驗通過其LLM網關默認使用開源權重模型,如GLM 5.2和Kimi 2.7,同時鼓勵工程師為特定任務選擇合適模型。有趣的是,91%的員工從未達到使用上限,因此降低上限只會增加不必要的警報,而轉向更便宜的默認模型是更有效的策略。代碼審查環節使用多種模型,相互校驗,進一步提升了整體質量。

其次,更好的路由機制顯著降低了成本。在自定義的提示處理框架中,Coinbase預處理提示,並根據緩存命中率和模型定價將任務路由到最佳模型。例如,規劃任務可能使用前沿模型,但執行任務使用前沿模型可能大材小用。Armstrong認為,最終不應該由人類選擇模型,AI可以自動化這一任務。

第三,緩存優化是成本控制的關鍵。緩存未命中是推高成本的最簡單方式。Coinbase的所有請求都具備緩存感知能力,儘可能重用熱緩存。例如,在LibreChat中,正確實施緩存後,緩存命中率從5%躍升至60%。

此外,上下文管理也至關重要。Armstrong建議在切換任務時開啓新會話,縮小文件上下文範圍,斷開未使用的工具連接。目標不是減少令牌使用量,而是減少令牌浪費。

最後,使用可見性讓工程師瞭解其AI使用情況。工程師可以自由使用任意數量的令牌和模型,但使用情況被透明化,預期AI支出越多,產生的影響越大。

這些措施實踐下來,Coinbase的AI支出幾乎減半,而令牌使用量持續增長。Armstrong的帖子引發了社區廣泛討論,包括對開源模型後訓練的建議,以及構建AI推理引擎以解決成本與可靠性問題的觀點。