AI News HubLIVE
サイト内リライト2 分で読了

Stoke – 暴走AIエージェントのキルスイッチ(Rust、予算上限)

Stokeは軽量なRustゲートウェイで、AIエージェントのAPI呼び出しがプロバイダーに到達する前に、ハードな予算上限、ループ検出、レート制限を強制し、暴走支出を防止します。また、複数マシンにわたるローカルファーストのルーティング、コスト/速度に基づく自動ルーティング、フェイルクローズドアーキテクチャを提供します。

ソースHacker News AI著者: pawfromoz

StokeはRustで構築された軽量ゲートウェイであり、AIエージェントが暴走した際の問題を解決するために設計されました。エージェントが深夜にループし始めても、従来の監視ダッシュボードは事後的にしか通知できませんが、Stokeはリクエストがプロバイダーに到達する前に介入します。予算上限は米ドル単位で各APIキーごとに設定でき、超過すると即座に429ステータスコードを返し、エージェント自身がエラーを処理できるようにします。

予算制御に加えて、Stokeは二重層のサーキットブレーカーを提供します。正確なプロンプトハッシュマッチングとオプションの意味的類似性検出により、ループが言い回しを変えても検出可能です。また、各APIキーにはスライディングウィンドウ方式のレート制限が適用され、単一のエージェントがリソースを占有するのを防ぎます。さらに、フェイルクローズドアーキテクチャを採用しており、キーが設定されていない場合はすべてのリクエストを拒否します。

ルーティング面では、Stokeはローカルファーストのマルチノードルーティングをサポートします。Ollamaノードを自動的にポーリングし、RAMにロードされているモデルを把握して、ウォームノードを優先し、複数マシン間で負荷を分散します。ノードが利用不可の場合は自動的にフェイルオーバーします。また、ゲートウェイ間のフェデレーションも可能で、一方のStokeゲートウェイをもう一方のバックエンドとして使用できます。

自動ルーティングモードでは、推定コスト、予測レイテンシ、ユーザーの優先順位に基づいて最適なモデルとノードの組み合わせを選択します。'auto-cheap'はコストを重視し、'auto-fast'は速度を重視します。小規模なプロンプトに対しては、ヘッジディスパッチが可能で、2台のマシンに同時にリクエストを送信し、先に完了した方の結果を採用します。これによりクラウドコストが増えることはありません。

各リクエストの決定経路はJSON形式で返され、選択されたノード、選択されなかったノードとその理由、およびクラウドモデルを使用した場合の推定コストが含まれます。これにより、支出が透明に追跡できます。

Stokeのデプロイは非常に簡単で、約5.5MBのRustバイナリのみで、実行時に依存関係は不要です。インストールは一行のコマンドで完了し、設定ファイルでノードとプロバイダーを指定するだけです。現在、主に3種類のユーザーを対象としています:従量課金のAPIキーを使用するコーディングエージェント、複数のGPUマシンを所有するチーム、そしてAI製品のコントロールプレーンを構築したい開発者です。最後のユースケースはまだ開発中であり、デザインパートナーを募集しています。

LiteLLM、Portkey、Heliconeなどの類似製品と比較すると、Stokeの強みは監視ではなく執行にあります。幅広いプロバイダーカバレッジや深い可観測性を追求せず、リクエストパス上で不正なリクエストを拒否することに特化しています。ループキルスイッチ、フェイルクローズドデフォルト、ノード認識ルーティング、ゲートウェイフェデレーションが独自のセールスポイントです。

注意点として、Stokeのハード予算上限は従量課金のAPIキーにのみ適用され、サブスクリプションプラン(Claude MaxやChatGPT Plusなど)に対してはドル単位の上限は設定できませんが、レート制限やループ停止は可能です。Stokeはデータ主権を重視しており、プロンプトはデフォルトでユーザーのインフラ内に留まり、明示的に設定しない限りクラウドプロバイダーに送信されません。

全体として、StokeはAIエージェントの暴走に悩むチームに対して、経済的なガードレールと技術的な無限ループ防止の両方を提供し、ローカルデプロイの柔軟性と安全性を維持する効果的な制御ツールです。