AI News HubLIVE
サイト内リライト2 分で読了

Coinbase、オープンモデルに移行。AIコストを半減しつつトークン使用量を増加

Coinbaseは、より優れたデフォルト設定、ルーティング、キャッシュ戦略により、AI支出をほぼ半減させながらトークン使用量を増やしました。彼らはデフォルトでGLM 5.2やKimi 2.7などのオープンウェイトモデルを使用し、キャッシュヒット率を最適化し、コンテキストを簡潔に保っています。

ソースHacker News AI著者: smurda

CoinbaseのCEOであるBrian Armstrong氏は最近、AI支出を増やさずにトークン使用量の指数関数的な成長を支える方法について、ソーシャルメディアで詳細に説明しました。同氏は、より優れたデフォルト設定、ルーティング、キャッシュ戦略を通じてコスト最適化を実現する一連の戦略を共有しました。Armstrong氏は、使用制限やアラートで利用を抑えるのではなく、よりスマートなインフラを構築することで持続可能な成長を可能にすることが目標だと強調しています。

まず、デフォルト設定の重要性が指摘されました。エンジニアは任意のモデルを選択できますが、デフォルトのモデルがコストに大きな影響を与えます。Coinbaseは、LLMゲートウェイを通じてGLM 5.2やKimi 2.7などのオープンウェイトモデルをデフォルトとして使用する実験を行っており、同時にエンジニアがタスクに適したモデルを選択することを促しています。興味深いことに、従業員の91%は使用上限に達したことがなかったため、上限を引き下げてアラートを増やすよりも、より安価なデフォルトに移行する方が効果的です。コードレビューでは多様なモデルを使用し、相互にチェックすることで品質も向上しています。

次に、より優れたルーティングメカニズムがコスト削減に貢献しました。カスタムのプロンプト処理フレームワークでは、プロンプトを前処理し、キャッシュヒット率とモデル価格を考慮して最適なモデルにルーティングします。例えば、計画タスクには最先端モデルが適しているかもしれませんが、実行タスクではオーバースペックになる可能性があります。Armstrong氏は、最終的には人間がモデルを選択するのではなく、AIがこのタスクを自動化すべきだと考えています。

第三に、キャッシュの最適化がコスト管理の鍵です。キャッシュミスはコストを押し上げる最も簡単な方法です。Coinbaseのすべてのリクエストはキャッシュ対応であり、可能な限りウォームキャッシュを再利用します。例えば、LibreChatでは適切に実装された後、キャッシュヒット率が5%から60%に向上しました。

さらに、コンテキスト管理も重要です。Armstrong氏は、タスクを切り替える際に新しいセッションを開始し、ファイルコンテキストを狭く設定し、未使用のツールを切断することを推奨しています。目標は使用トークン数を減らすことではなく、無駄なトークンを減らすことです。

最後に、使用状況の可視化により、エンジニアは自身のAI使用量を把握できます。エンジニアは好きなだけトークンやモデルを使用できますが、使用状況は透明化され、AIへの支出が多ければ多いほど、より大きなインパクトが期待されます。

これらの施策を実践した結果、CoinbaseのAI支出はほぼ半減し、トークン使用量は増加を続けています。Armstrong氏の投稿はコミュニティで大きな議論を呼び、オープンモデルのポストトレーニングや、コストと信頼性の問題を解決するAI推論エンジンの構築に関する提案が寄せられました。