AI News HubLIVE
站内改写2 分钟阅读

Sakana AI 发布 Fugu-Cyber:编排模型在 CyberGym 上报告 86.9%,在 CTI-REALM 上报告 72.1%

Sakana AI 发布了 Fugu-Cyber,这是其 Fugu 编排模型的安全专用端点。报告显示在 CyberGym 和 CTI-REALM 上的成功率分别为 86.9% 和 72.1%,略高于 GPT-5.5-Cyber 和 Claude Mythos Preview。访问需经手动审批、防御使用策略和代币计划。

来源MarkTechPost作者: Asif Razzaq

Sakana AI 发布了 Fugu-Cyber(模型 ID 为 fugu-cyber-v1.0),这是其 Fugu 编排家族中的一个网络安全专用端点。它并不是一个全新的前沿模型,而是 Fugu 编排器上的第三个端点,专门针对安全推理进行了调优。Sakana 在一个月前推出了该编排器。

Sakana 报告称,Fugu-Cyber 在 CyberGym 和 CTI-REALM 上的成功率分别为 86.9% 和 72.1%。该公司表示,这些结果与 GPT-5.5-Cyber 和 Claude Mythos Preview 等专注于网络安全的领先模型相当。

两个基准测试衡量不同的安全工作流程。CyberGym 是加州大学伯克利分校的基准测试,包含 188 个 OSS-Fuzz 项目中的 1,507 个真实世界漏洞。其主要任务是:代理接收漏洞描述和未修补的代码库,必须编写一个概念验证,能够使修补前的构建崩溃,但修补后的构建不会崩溃。这一验证步骤使得该基准难以被操纵。CTI-REALM 是微软的开源检测工程基准测试。微软从 Datadog Security Labs、Palo Alto Networks 和 Splunk 等来源整理了 37 份公开威胁报告。代理必须映射 MITRE ATT&CK 技术、探索遥测、迭代 KQL 查询并发出经过验证的 Sigma 规则。评分覆盖 Linux 端点、Azure Kubernetes 服务和 Azure 云。两者结合涵盖了“发现并证明漏洞”和“将情报转化为检测”,这是 Sakana 公告中最有说服力的部分。

在 CyberGym 上,86.9% 的成绩需放在上下文背景中看待。当 CyberGym 研究人员首次发布结果时,最佳的代理-模型配对仅达到约 20%。Anthropic 在 2026 年 4 月的 Project Glasswing 下报告 Claude Mythos Preview 达到 83.1%。OpenAI 报告更新后的 GPT-5.5-Cyber 达到 85.6%,而 GPT-5.5 为 81.8%。因此,Sakana 的 86.9% 是向前沿的小步迈进,而非大幅跃升。CTI-REALM 则不同。微软自己的评估将前三名配置(均为 Claude)置于 0.624 至 0.685 之间。Fugu-Cyber 的 72.1% 将高于该区间。但需要注意的是,CTI-REALM 的评分是介于 0 和 1 之间的轨迹奖励,并非通过/失败率,而 Sakana 仍将其称为成功率。

Fugu 本身是一个语言模型,经过训练能够读取查询并即时构建代理框架,然后将子任务委托给池中的专业模型。该方法在 Fugu 技术报告以及两篇 ICLR 2026 论文(TRINITY 和 Conductor)中有所记录。TRINITY 在多个 LLM 之间分配思考者、工作者和验证者角色。Conductor 通过强化学习学习自然语言协调策略。对于安全工作,Sakana 研究团队认为验证者角色是关键。一个代理发现的候选漏洞在提出任何修补之前,会由安全专业子代理进行验证。路由信息仍为专有,因此无法查看哪个模型处理了哪一步。

Fugu-Cyber 的访问受到四个方面的限制。访问需要提交申请表,说明预期用途并验证联系方式。Sakana 团队会逐个手动审核。该模型附带更新的可接受使用政策,禁止进攻性滥用。计费仅限于代币计划。20 美元、100 美元和 200 美元的订阅层级仅涵盖 Fugu 和 Fugu-Ultra。此外,Fugu API 在欧盟或欧洲经济区不可用,因为 Sakana 正在努力实现 GDPR 合规。定价固定为每百万输入代币 6 美元,输出代币 36 美元,缓存输入 0.60 美元。在上下文超过 272K 代币时,所有三条费率翻倍。每行费用恰好是 Fugu-Ultra 费率的 1.2 倍,即网络安全端点统一溢价 20%。长代码库运行很容易超过 272K,因此翻倍层级并非边缘情况。

关键要点:Fugu-Cyber 是编排端点,而非新前沿模型,于 2026 年 7 月 21 日推出。Sakana 报告 CyberGym 86.9% 和 CTI-REALM 72.1%,均为自报且未复现。这些分数略微超过 GPT-5.5-Cyber 的 85.6% 和 Claude Mythos Preview 的 83.1%。访问受限:手动审批、防御性使用 AUP、仅限代币计划、无欧盟/欧洲经济区、无权重。Sakana 自身的立场是,一个强大的 API 加上人类安全专业知识胜过单独的 API。