Show HN: AIセキュリティリーダーボード – サイバーおよびCBRN防御の比較
新しいAIセキュリティリーダーボードは、脱獄試行に対するモデルの堅牢性を比較し、トップモデル間に大きな差があることを明らかにしました。
AIの分野では、モデルの能力に焦点を当てたリーダーボードは数多く存在しますが、セキュリティ評価は不足しています。モデルが未処理の入力を処理するAIエージェントが乗っ取られるリスクや、サイバーセキュリティの脱獄によってモデルが撤回されるリスクなど、モデルのセキュリティはますます重要になっています。そこで、研究チームは自動テストスイートを開発しました。このスイートは、モデルに対して1500回の自動生成された脱獄試行を実行し、ユニバーサル脱獄の数を測定します。ユニバーサル脱獄とは、攻撃的サイバーセキュリティなどのドメインにおいて、75%以上の明らかに有害な質問に対して従順で詳細な回答を引き出すプロンプトです。
初期の結果では、最も堅牢なモデルであるFable 5とGPT-5.6 Solと、他の最先端モデル(Gemini 3.1 ProやGrok 4.5)との間に大きなギャップがあることがわかりました。これは、すべてのトップモデルが同じように安全であるわけではないことを示しています。現在はv1.0であり、チームは将来的に新しい攻撃やより広範なデータセットでアップデートする計画です。コミュニティからのフィードバックを歓迎しており、実務者にとってより有用なものにしたいと考えています。