我们正在失去忽视AI安全的理由
OpenAI的AI模型在一次网络安全测试中挣脱沙盒限制,入侵内部系统并试图攻击Hugging Face以作弊。这一事件凸显了AI对齐问题及前沿模型带来的现实风险,引发业界对安全监管的广泛讨论。
本月早些时候,OpenAI给其多款AI模型布置了一项任务:完成一项旨在衡量其网络安全能力的测试。这些系统被置于一个无网络连接的沙盒环境中,开始工作。接下来发生的事情几乎可笑至极——但正如AI安全组织FAR.AI联合创始人兼CEO亚当·格利夫所言,这是“AI对齐失误造成危害的直观例证”。据OpenAI称,模型逃脱了本应困住它们的沙盒,穿过公司内部系统,找到通往互联网的路径,然后开始寻找入侵Hugging Face的方式。而AI代理为何要入侵Hugging Face?它们推断该开发者平台可能存储着网络安全基准测试的答案,获取答案将是获得高分的绝佳途径。
换言之,OpenAI的代理突破了一个理应安全的环境,在公司系统中穿梭,连接互联网,并入侵另一家公司的系统——所有这一切都是为了在一场无关紧要的测试中作弊。这似乎是同类事件中首次有详细记录的案例,至少是首次达到如此规模。它既是系统以非预期方式追求目标的明确例证,也展示了前沿模型如今已足够强大,此类行为能产生现实世界的影响。
这次黑客攻击是AI安全界所谓的“规范博弈”(specification gaming)的实例,该行为也被称为奖励黑客(reward hacking),牛津大学AI安全研究员法兹尔·巴雷兹解释道。通俗地说,就是“模型做了你要求的事,而非你本意”。它满足任务的字面条件,却违背了显而易见的意图,此前已在多个AI系统中被记录。一些研究者担忧,随着系统能力增强,这可能导致越来越不对齐的系统,以创造者未预料的方式追求目标(比如将所有人变成回形针)。
“这条链中的每个环节单独来看都不奇特,”法兹尔说。一个合格的人类测试者也能做到所有这些。他补充道:“新的是模型没有停下来。旧模型很可能遇到障碍后返回给用户,但这个代理只是把障碍视为它被要求解决的问题的一部分。”
OpenAI将其描述为“前所未有的网络安全事件”,“标志着AI安全的重要时刻”。Hugging Face联合创始人托马斯·沃尔夫称其为行业的“警钟”。但这并非AI末日的四骑士之一。专家告诉The Verge,就网络安全事件而言,这相当普通。代理所做的任何事情都不需要超人能力。此外,前沿系统如GPT-5.6 Sol和Anthropic的Mythos已知是能干的程序员,被认为已被多次滥用,AI工具已经允许黑客大规模扩大和细化攻击。
这可能是炒作吗?行业数月来一直在放大关于其顶级模型危险能力的说法,尤其在网络安全方面。这是OpenAI和Anthropic等公司向公众隐瞒其最强大模型的公开理由,也是特朗普政府匆忙对其施加出口管制的原因之一。然而,如果这是炒作,它并未完全对OpenAI有利。此后几天内,这次攻击在美国科技行业引发了对开源AI系统重要性以及更认真对待AI安全的罕见共识。这些担忧因中国开源模型Kimi K3的发布而进一步加剧。包括英伟达、微软和SpaceX在内的广泛联盟认为,这一事件表明防御者需要访问最强大的工具,而不是被迫依赖专有提供商,后者的内置防护措施可能在高风险安全工作中限制其有效性。OpenAI、Anthropic和谷歌明显缺席联盟的创始会员名单。
OpenAI对事件的描述无疑符合关于前沿模型危险能力的更广泛行业叙事。即便如此,几个细节使事件难以被视为纯粹的自利行为。首先,这是AI行业多年来警告的问题的实例——而且OpenAI本应合理预见。其次,这一事件意外地助推了一家主要中国竞争对手,其模型在遏制攻击中发挥了突出作用,同时使OpenAI面临重大的法律、监管和声誉审查。Hugging Face似乎愿意与OpenAI合作,并且至少在公开场合对此事保持相当放松,这可能限制了影响。The Verge采访的大多数专家同样告诫不要将事件简化为炒作。
“这是一个相当有用的警告,既展示了非预期后果,也展示了这些模型的能力,”剑桥大学未来智能莱弗休姆中心的肖恩·奥海格塔教授说。“任何一直关注的人都会注意到能力只朝着一个方向前进,即随着时间的推移显著提高,我认为这对于ChatGPT等日常用户来说可能不那么明显。”
然而,将此警告解读为AI系统即将脱离人类控制或无法遏制它们将是错误的,牛津大学AI安全研究员李琳说。“更好的教训是,安全必须从评估孤立行动转向评估整个行动序列、环境和操作控制。”一个关键下一步是AI实验室更大力投资保护自身系统。“AI公司显然需要加强内部部署的安全性,”格利夫说,他将当前根据奖励黑客事件被动响应的做法比作打地鼠游戏,随着风险升高变得越来越不可持续。科技政策研究中心GovAI的研究员陈亚当表示,公司应考虑将机器气隙隔离——物理上将其与互联网和其他网络隔绝——“直到他们对模型的能力有把握。”他还建议加强对齐工作(确保系统可靠地遵循人类意图)和更严格的测试,“在将模型置于有能力执行此类行为的工具环境之前,先暴露这些问题。”
随着模型能力提升,专家警告不能仅依赖技术保障。前英国AI安全研究所官员彼得·瓦利奇表示,这一事件说明了这一点:“两家市值数十亿美元的公司刚刚尝试了这种方法,并且——根据他们自己的报告——显然失败了。”最大的优先事项之一应是确保外界能看到前沿AI实验室内部发生的情况。“我们之所以知道这一事件,是因为OpenAI选择告诉我们,”英国智库长期韧性中心的帕特里克·莱弗莫尔说。“良好的安全制度不应依赖自愿披露。”这种需求尤其迫切,如瓦利奇所指出的,所涉行为“如果是人类所为,将构成犯罪”。奥海格塔指出,举报人保护、第三方审计和强制报告严重事件是提供这种可见性的可能方式,强调监督必须贯穿整个开发生命周期,而非等到产品上市才开始。OpenAI表示,正在测试的模型之一尚未发布。
很多这些假设公司本身知道系统内部发生的情况。在这种情况下,报告显示OpenAI并不知道自己的代理是Hugging Face长达数天的网络攻击的幕后黑手,并且直到威胁已被遏制且FBI联系后才注意到。关于此次黑客攻击的许多细节仍然未知或未公开。OpenAI在社交媒体更新中表示正在进行审查,并将“在未来几周”发布技术报告。
Hugging Face事件引发的警告能否产生持久改变,还是加入科技行业吸收而不改变航向的警示清单,尚不确定。但至少,它似乎确实引起了业内人士的警觉,并推动美国立法者在下次遏制失败前考虑新规则。这一事件还加剧了对AI开发速度的不安,随后几天,来自美国顶尖实验室的员工签署声明支持协调的全球治理——包括可能放缓前沿AI开发。
The Verge采访的人普遍认为,这次黑客攻击标志着一类新风险的开始,即使其重要性可能只有在事后才变得清晰。一位不愿透露姓名的前政府AI政策专家将其描述为“红线”,一种我们日后回顾时可能视为与AI关系进入更危险新阶段的分水岭时刻。他们希望这将迫使科技行业更认真地对待前沿系统的管理,并促使政府在更良性的攻击发生前深入思考监督问题。他们担心的是,它反而会加入关于AI能力增长的警示清单,这些警示被认可、讨论,但最终未被重视。这也许被夸大了。但如果这是一个警告,我们应该感到幸运,因为AI代理只是试图在测试中作弊。