AI安全机构报告称Anthropic的Mythos进化速度超出预期
仅在其首次发布一个月后,Anthropic著名的Mythos模型就突破了新的测试界限。
据英国AI安全研究所(AISI)周三发布的博客,Anthropic的Claude Mythos模型——该公司认为其过于强大而不宜公开发布——已经展现出新的能力。AISI对Mythos的更新版本进行了测试,结果显示其不仅超越了早前的版本,还超过了OpenAI的GPT-5.5,而距离Mythos最初发布仅过去一个月。
AISI在博文中写道:“新的Mythos Preview检查点完成了我们的两个网络范围,在10次尝试中,有6次成功解决了‘The Last Ones’范围,并首次以3/10的成功率攻克了此前未解的‘Cooling Tower’范围。这是模型首次完成我们两个网络范围中的第二个。”当Anthropic上个月首次宣布Mythos Preview和Project Glasswing——一个由竞争对手科技公司和AI实验室组成的网络安全测试联盟,并向其提供Mythos的有限访问权限——时,AISI进行了评估,发现该模型“代表着前沿模型在网络安全性能已经迅速提升的背景下又迈上了一个台阶。”这一第三方视角有助于平衡关于Mythos的两种极端说法:要么纯属营销炒作,要么预示着AI能力的灾难性转变。该模型的实际能力很可能介于两者之间。
AISI的更新测试也表明,能力提升并不局限于单个模型版本,而是可以在同一模型的不同版本内部发生。AI模型在处理网络安全任务方面的能力正在迅速提升,这对网络安全具有重大影响,尤其是考虑到Mythos在检测软件漏洞方面的特长。博文作者写道:“2026年2月,我们内部估计,自2024年底以来,AI模型能够完成的网络安全任务长度每4.7个月翻一番——这已经比我们2025年11月估计的8个月加速了。此后,AISI报告了两种新模型,Claude Mythos Preview和OpenAI的GPT-5.5,它们都大幅超过了这两种翻倍趋势。”作者补充说,尚不清楚这一趋势是否会持续,或者这些发现是否只是暂时的异常。Mythos和GPT-5.5可能只是模型进化总体模式中的显著例外。
不过,AISI澄清说,其测试存在若干未知因素。测试将任务限制在250万token以内,以便研究人员更好地比较随时间变化的性能结果。但这本身就“低估了前沿模型的能力”,他们写道。“由于在我们的狭窄网络套件中最长任务上的成功率接近100%,即使有250万token的限制,Mythos Preview和GPT-5.5也拥有很大的上界误差条。我们的任务长度也不足以确定模型在更高任务长度下的可靠性会如何急剧下降。这使得一些最新模型处于我们狭窄测试套件所能测量的极限。”虽然这使得模型失败点难以测量,但也意味着如果没有token上限,模型在这些任务上的成功率会高得多——事实上,高到“时间线变得无法计算”。拥有更多token访问权限和复杂代理基础设施的模型将具有更强的能力。博文补充道:“250万token的限制相对较低——在我们的网络范围实验中,我们使用高达1亿token,并发现性能在这种预算下可能仍然会提高,尤其是对于近期模型,它们能从更高的token限制中不成比例地受益。”