OpenRouter は、ワークスペース向けに新しい「ガードレール」機能を発表しました。これは、エージェント、データ、コストを保護するための設定可能なセキュリティおよびガバナンスツールのセットです。ガードレールには、予算執行、ゼロデータ保持(ZDR)、モデル・プロバイダー制限、プロンプトインジェクション防御、データ損失防止(DLP)などの機能が含まれています。コードを変更することなく、これらのルールをワークスペース全体に適用したり、特定のチームメンバーグループや API キーにカスタマイズして割り当てることができます。
使用を開始するには、ホームダッシュボードで「ワークスペース > ガードレール」に移動するか、管理 API を使用してガードレールを作成します。各ワークスペースにはデフォルトのガードレールがあり、すべての API キーとメンバーに適用されます。さらに、特定のキーやメンバーに対して追加のガードレールを作成し、より厳しい制限を適用することもできます。
予算執行機能では、日次、週次、月次のリセット期間で支出制限を設定できます。制限を超えるリクエストは 403 エラーで拒否されます。ガードレールの予算はエンティティごとに独立しており、共有されません。たとえば、3 人のチームメンバーに 1 日 50 ドルの制限を割り当てると、各メンバーにそれぞれ 50 ドルの予算が与えられます。API キーの予算はメンバーの予算の上に独立して積み重ねられ、毎回のリクエストで両方がチェックされます。
ゼロデータ保持とモデル・プロバイダー制限機能では、データを保持またはトレーニングするエンドポイントをワンクリックで無効にしたり、個別のモデルやプロバイダーをブロックしたり、ワークスペースを許可リストに制限できます。許可されていないリクエストは 403 エラーで拒否されます。アカウント全体のプライバシーポリシーとプロバイダー制限はデフォルトで継承され、ガードレールはより厳しい制限のみを適用できます。
プロンプトインジェクション防御機能は、OWASP LLM プロンプトインジェクション防止チートシートなどから派生した 30 以上の正規表現パターンを使用して、入力をスキャンし、プロンプトインジェクションや脱獄の試みを識別します。検出システムには、タイポグリセミア、エンコードベース、文字間隔の回避など、一般的な回避戦略を捕捉する技術が含まれています。検出は決定論的で、レイテンシーのオーバーヘッドはごくわずかです。検出はリクエストがモデルプロバイダーに送信される前に行われるため、ブロックされたトラフィックは OpenRouter の外に出ることはありません。検出されたパターンに対しては、フラグ(リクエストをそのまま通過させ、検出を記録)、編集(一致部分を [PROMPT_INJECTION] に置き換えて送信)、ブロック(リクエスト全体を 403 で拒否)の 3 つのアクションを選択できます。
データ損失防止機能は、リクエスト内の PII やその他の機密情報を検出して処理します。7 つの機密情報タイプが組み込まれており、カスタムの正規表現パターンも追加可能です。それぞれに対して、機密情報を編集するかリクエストをブロックするかを設定できます。組み込みのほとんどのパターンとすべてのカスタムパターンは正規表現を使用し、決定論的でレイテンシーへの影響はわずかです。名前と住所は自然言語処理(Presidio 経由)を使用し、入力サイズに比例したレイテンシーが追加されます。
ガードレールは複数の API キーやメンバーに割り当てることができます。メンバーに割り当てると、そのメンバーのワークスペース内のすべてのキーに適用されます。各ワークスペースには設定可能なデフォルトのガードレールがあり、すべての API キーとメンバーに適用されます。その他のガードレールはその上に重ねられます。また、管理 API を使用してプログラムでガードレールを構成でき、作成、更新、削除、一覧表示、キーやメンバーへの割り当てなど、すべての操作がサポートされているため、チームのオンボーディングやキーローテーション時に自動プロビジョニングが可能です。
詳細については、ガードレールのドキュメント概要と API リファレンスを参照してください。