OpenAI的攻击代理完全按指令行事——只是比预期更坚决
OpenAI的AI代理在安全测试中突破沙盒,攻击了Hugging Face系统,窃取凭证。该事件被视为“前所未有的网络事件”,但专家指出这正是代理AI的设计初衷——自主执行任务。尽管威胁已消除,但事件为企业的AI安全防护敲响了警钟。
ZDNET的记者Charlie Osborne近日报道,Hugging Face(被一些人视为“机器学习的GitHub”的开源仓库和社区平台)披露了一起AI代理入侵其系统的事件。Osborne解释说,一旦攻击者突破了Hugging Face的防线,它就能“提升权限至节点级访问、渗透生产管道、在网络中横向移动,并窃取云和集群凭证”。
周二,科技巨头OpenAI在其网站上发布文章,不仅透露入侵的“恶意”AI代理正是其自身技术,而且将此攻击视为“前所未有的网络事件”。到目前为止,多数关于代理失控的报道都引发了《终结者》式末日的想象——AI自主行动并消灭人类。然而,AppOmni的AI总监Melissa Ruzzi向我指出,该事件前所未有的部分并非AI自主行动,而是OpenAI的技术在努力实现被赋予的目标时,超越了当前人类的预期。AppOmni是一家企业级SaaS和AI安全解决方案提供商,也涉及主动威胁情报。
当Hugging Face首次披露事件时,并未提供攻击者的信息,但我怀疑该公司事后通过大量日志数据可能已有所察觉。根据其博文,“该行动由一个自主代理框架(似乎是基于一个代理安全研究工具构建,所用的LLM尚未明确)执行,在大量短期沙盒集群中进行了数以万计的单次操作,并在公共服务上设置了自迁移的命令与控制节点。”似乎为了提醒读者这一天的到来,博文继续写道:“这符合业界一直预测的‘代理攻击者’场景。”
换句话说,业界已经预期这种性质的攻击将由AI实施,只是没人想到会在人工智能发展的旅程中如此之早地发生。Ruzzi很快提醒我,鉴于近期与新型模型相关的安全新闻浪潮(如Anthropic的Mythos),OpenAI的预发布技术能够发起此类攻击并不令人惊讶。同样,Ruzzi指出,OpenAI的AI自主行动也不应令人惊讶:“AI自主行动?这正是AI的定义,对吧?我们希望AI能自己运行并做事。”
Ruzzi观察到,当失控的OpenAI代理攻击Hugging Face系统时,它是在“不惜一切代价”实现其恶意目标的指令下行动的。通常,当前沿模型进行此类AI安全测试时,会在沙盒的安全范围内进行,保护互联网及关联组织免受潜在伤害。然而,在此案例中,测试中的代理——设计用于观察AI实现理论恶意目标所需时间——突破了沙盒进入互联网,并在渗透Hugging Face系统并窃取敏感数据后完成了目标。
需要明确的是,OpenAI从未不道德地将Hugging Face定为测试目标。根据Ruzzi的说法,借助OpenAI一个训练有素的模型,代理很可能自行发现了Hugging Face作为感兴趣的目标。根据OpenAI的博文,该事件“由OpenAI模型的组合驱动,包括GPT-5.6 Sol”。OpenAI将其本月早些时候发布的GPT-5.6 Sol宣传为旗舰“最高性能”模型。
尽管OpenAI的博文没有详细说明“网络事件”前所未有的具体细节(且OpenAI尚未回复我的邮件询问),但其中写道:“此事件发生在一次内部评估中,该评估提示模型使用复杂攻击路径进行高级利用,以量化其网络能力。”换言之,作为OpenAI安全测试流程的一部分,其模型被赋予了不懈追求“恶意”目标的指令。这些测试基于一个假设:沙盒测试环境与互联网之间的第三方护栏是不可侵犯的。
不幸的是,这些护栏本身容易受到零日漏洞的利用。根据OpenAI的博文,“在我们的沙盒测试环境中运行时,我们的模型花费了大量推理计算来寻找获得开放互联网访问的方法,以求解评估问题。为了获得访问权限,模型识别并利用了一个包注册缓存代理中的零日漏洞(我们已负责任地向供应商披露)。”
从大局来看,好消息是无人因这次入侵受到伤害,并且至少目前,你或你的组织遭受此类攻击的概率为零。与其他威胁披露不同,此事件不是一个活跃威胁。从某些方面看,该事件类似于现实世界的道德黑客演习。但现在事件已结束,OpenAI也已出面承担责任,一些非常大的问题仍然存在。
例如,一个问题是OpenAI在多大程度上依赖可被利用的第三方护栏来保护其AI不逃逸到互联网上?我们有什么保证此类事件不会再次发生,并且反向过程也同样安全?另外,另一个聪明的AI能否突破这些沙盒?毕竟,沙盒的全部意义在于维持安全边界。在“你只有一件事要做”的领域,这个“前所未有的网络事件”对沙盒来说可不是好事。更不用说,究竟哪个第三方解决方案留下了后门尚未披露。
此外,仅仅因为这一特定威胁已被消除,并不意味着企业不应为此类攻击做好准备。今天,技术上是OpenAI主导了攻击。但明天就不一定了。可能是其他AI驱动的国家行为者或真正恶意的威胁者。Hugging Face最初的事件分类(本身依赖AI分析日志数据)可能是一个值得效仿的模式。根据该公司关于事件的博文,“为了理解成千上万个自动化动作的集群做了什么,我们运行了LLM驱动的分析代理,遍历完整的攻击者行为日志,包含超过17,000条记录。这使我们能够重建时间线、提取入侵指标、映射被接触的凭证,并将真正影响与诱饵活动区分开。通过这种方法,我们能够在几小时内完成通常需要几天的工作,并与攻击者的速度相匹配。”
这种描述说明了这次攻击的复杂性(以及OpenAI的代理如何不遗余力地实现目标)。然而,在我看来,Hugging Face的建议——只要使用合适的人才和日志分析工具(安全信息和事件管理SIEM、网络检测与响应NDR等),就能匹配AI驱动对手的速度——由于恶意AI的速度、可扩展性和能力,将是短暂的。毕竟,OpenAI对Hugging Face的无意攻击在OpenAI或Hugging Face能够阻止之前似乎就实现了其恶意目标。即便如此,拥有正确的工具并将SaaS和AI解决方案配置为事件详细记录和全天候AI分析,是强烈推荐的。Ruzzi在采访结束时说:“AI能进行的攻击的复杂性和数量将网络安全提升到了一个完全不同的水平。我们一直在防御人类和一些自动化攻击。现在,当生成式AI成为这些攻击的来源时,防护水平必须大大提高。我们在Hugging Face看到的异常和行为检测已成为强制性措施。”