AI News HubLIVE
站內改寫2 分鐘閱讀

Coinbase轉向開源模型,AI開支減半同時令牌使用量增長

Coinbase透過更好的預設設定、路由和快取策略,將AI支出幾乎減半,同時令牌使用量持續增長。他們預設使用開源權重模型如GLM 5.2和Kimi 2.7,最佳化快取命中率,並保持上下文精簡。

來源Hacker News AI作者: smurda

Coinbase執行長Brian Armstrong近日在社交媒體上詳細介紹了公司如何在不增加AI支出的情況下支援令牌使用量的指數級增長。他分享了一系列策略,核心在於透過更好的預設設定、路由和快取來實現成本最佳化。Armstrong強調,目標不是透過設定上限或傳送警報來限制使用,而是透過建設更智慧的基礎設施,使增長可持續。

首先,Armstrong指出預設設定的重要性。工程師可以選擇任何模型,但預設模型對成本影響巨大。Coinbase正在試驗透過其LLM閘道器預設使用開源權重模型,如GLM 5.2和Kimi 2.7,同時鼓勵工程師為特定任務選擇合適模型。有趣的是,91%的員工從未達到使用上限,因此降低上限只會增加不必要的警報,而轉向更便宜的預設模型是更有效的策略。程式碼審查環節使用多種模型,相互校驗,進一步提升了整體質量。

其次,更好的路由機制顯著降低了成本。在自定義的提示處理框架中,Coinbase預處理提示,並根據快取命中率和模型定價將任務路由到最佳模型。例如,規劃任務可能使用前沿模型,但執行任務使用前沿模型可能大材小用。Armstrong認為,最終不應該由人類選擇模型,AI可以自動化這一任務。

第三,快取最佳化是成本控制的關鍵。快取未命中是推高成本的最簡單方式。Coinbase的所有請求都具備快取感知能力,儘可能重用熱快取。例如,在LibreChat中,正確實施快取後,快取命中率從5%躍升至60%。

此外,上下文管理也至關重要。Armstrong建議在切換任務時開啟新會話,縮小檔案上下文範圍,斷開未使用的工具連線。目標不是減少令牌使用量,而是減少令牌浪費。

最後,使用可見性讓工程師瞭解其AI使用情況。工程師可以自由使用任意數量的令牌和模型,但使用情況被透明化,預期AI支出越多,產生的影響越大。

這些措施實踐下來,Coinbase的AI支出幾乎減半,而令牌使用量持續增長。Armstrong的帖子引發了社群廣泛討論,包括對開源模型後訓練的建議,以及構建AI推理引擎以解決成本與可靠性問題的觀點。