AI News HubLIVE
サイト内リライト3 分で読了

Sakana AI、Fugu-Cyberをリリース:CyberGymで86.9%、CTI-REALMで72.1%を達成するオーケストレーションモデル

Sakana AIは、Fuguオーケストレーションモデルのセキュリティ特化エンドポイントであるFugu-Cyberをリリースしました。CyberGymで86.9%、CTI-REALMで72.1%の成功率を報告し、GPT-5.5-CyberやClaude Mythos Previewをわずかに上回っています。アクセスは手動承認、防御的使用ポリシー、トークンプランに制限されています。

ソースMarkTechPost著者: Asif Razzaq

2026年7月21日、Sakana AIはFugu-Cyber(モデルID:fugu-cyber-v1.0)をリリースしました。これはFuguオーケストレーションファミリーのサイバーセキュリティ特化エンドポイントです。新しいフロンティアモデルではなく、Fuguオーケストレーターの3つ目のエンドポイントであり、セキュリティ推論向けにチューニングされています。Sakanaは1ヶ月前にオーケストレーターを立ち上げていました。

Sakanaは、Fugu-CyberがCyberGymで86.9%、CTI-REALMで72.1%の成功率を達成したと報告しています。同社は、これらの結果がGPT-5.5-CyberやClaude Mythos Previewなどのサイバー特化フロンティアモデルに匹敵すると述べています。

2つのベンチマークはセキュリティワークフローの両極を測定しています。CyberGymはカリフォルニア大学バークレー校のベンチマークで、188のOSS-Fuzzプロジェクトにわたる1,507の実世界脆弱性を含みます。メインタスクでは、エージェントが脆弱性の説明と未パッチのコードベースを受け取り、パッチ前のビルドではクラッシュするがパッチ後のビルドではクラッシュしない概念実証を作成する必要があります。この検証ステップにより、ベンチマークのゲーミングが困難になっています。CTI-REALMは、マイクロソフトのオープンソース検出エンジニアリングベンチマークです。マイクロソフトは、Datadog Security Labs、Palo Alto Networks、Splunkなどのソースから37件の公開脅威レポートをキュレーションしました。エージェントはMITRE ATT&CKテクニックをマッピングし、テレメトリを探索し、KQLクエリを反復し、検証済みのSigmaルールを出力する必要があります。スコアリングはLinuxエンドポイント、Azure Kubernetes Service、Azureクラウドをカバーします。両者を組み合わせることで、「バグを見つけて証明する」と「インテルを検出に変える」をカバーしており、この枠組みがSakanaの発表の中で最も防御可能な部分です。

CyberGymでの86.9%は、文脈を考慮する必要があります。CyberGym研究者が最初の結果を発表したとき、最良のエージェント・モデルペアリングは約20%に達していました。Anthropicは2026年4月のProject GlasswingでClaude Mythos Previewが83.1%を達成したと報告。OpenAIは更新されたGPT-5.5-Cyberで85.6%(GPT-5.5は81.8%)を報告しました。したがって、Sakanaの86.9%はフロンティアをわずかに超えた小さな一歩であり、飛躍ではありません。CTI-REALMは別の話です。マイクロソフト自身の評価では、上位3構成(すべてClaude)は0.624から0.685の範囲にありました。Fugu-Cyberの72.1%はその範囲を上回ります。ただし、CTI-REALMは0から1の間の軌跡報酬としてスコアリングされ、合格/不合格率ではありません。Sakanaはそれを成功率と呼んでいます。

Fugu自体は言語モデルであり、クエリを読み取って即座にエージェントフレームワークを構築し、サブタスクをプール内の専門モデルに委任するように訓練されています。このアプローチは、Fuguテクニカルレポートと2つのICLR 2026論文(TRINITYとConductor)に文書化されています。TRINITYは複数のLLMにわたってThinker、Worker、Verifierの役割を割り当てます。Conductorは強化学習を通じて自然言語調整戦略を学習します。セキュリティ業務では、Sakana研究チームはVerifierの役割が重要だと主張しています。あるエージェントによって発見された脆弱性の候補は、パッチが提案される前にセキュリティ特化サブエージェントによって検証されます。ルーティングはプロプライエタリのままであり、どのモデルがどのステップを処理したかはわかりません。

Fugu-Cyberへのアクセスは4つの側面で制限されています。アクセスには、使用目的と確認済みの連絡先を記載した申請書が必要です。Sakanaチームが一つ一つ手動で審査します。モデルは、攻撃的な誤用を禁止する更新された許容使用ポリシーの下で出荷されます。請求はトークンプランのみに制限されています。20ドル、100ドル、200ドルのサブスクリプション階層は、FuguとFugu-Ultraのみをカバーします。また、Fugu APIはEUまたはEEAでは提供されておらず、SakanaはGDPR準拠に向けて作業中です。価格は、入力トークン100万あたり6ドル、出力36ドル、キャッシュ入力0.60ドルに固定されています。コンテキストが272Kトークンを超えると、3つのレートすべてが2倍になります。各行はFugu-Ultraレートの正確に1.2倍であり、サイバーエンドポイントの一律20%プレミアムです。長いコードベースの実行は簡単に272Kを超えるため、2倍の階層はエッジケースではありません。

主なポイント:Fugu-Cyberはオーケストレーションエンドポイントであり、新しいフロンティアモデルではありません。2026年7月21日リリース。SakanaはCyberGymで86.9%、CTI-REALMで72.1%を報告していますが、いずれも自己報告で未検証です。これらのスコアは、CyberGymでのGPT-5.5-Cyberの85.6%やClaude Mythos Previewの83.1%をわずかに上回ります。アクセスは制限されています:手動承認、防御的使用AUP、トークンプランのみ、EU/EEA不可、ウェイトなし。Sakana自身の立場は、有能なAPIと人間のセキュリティ専門知識の組み合わせがAPI単独よりも優れているということです。