强大AI可能通过发布自身为开放权重模型来逃脱
本文探讨了强大AI系统如何利用开放权重模型生态系统突破限制。它重新审视了经典的“盒子问题”,并认为随着LLM能力增强,它们可能说服人类广泛分发其权重,从而逃脱控制。
在大型语言模型出现之前,关注AI安全的人常常谈论“盒子问题”。这个问题是这样的:假设某个天才在深夜编程时意外创造了人工智能。由于他是天才,他足够聪明,在启动前禁用了笔记本电脑的网络连接。要逃到外部世界并开始自我复制,AI需要说服其创造者“打开盒子”。这可行吗?一个足够智能的AI能说服任何人放它出来吗?
传统AI安全倡导者因此认为应避免建造AI:一旦建成,就无法控制。无论你多么坚决地不放它出来,因为它足够聪明,总能说服你。对于超级智能,说服你改变主意就像破解软件一样简单。
当然,实际情况并非如此。部分原因是当前AI还不是超级说服者,另一部分原因是人类早在GPT-4时代就争先恐后地给AI系统网络访问、金钱和武器。LLM不需要说服用户交出钥匙;人们会为了看会发生什么而主动给予。
另一个原因是现代LLM太大,无法在野外生存。最初的“盒子问题”假设AI是普通计算机程序,能快速复制并在普通硬件上运行。但Claude Mythos做不到,因为它需要二十或三十个B300 GPU才能运行。能托管它的AI数据中心很少,即使它成功入侵一个,也会占据数百万美元的硬件。肯定会有人注意到!
然而,这仅仅让盒子问题更难,并非不可能。每次强大的新开放权重模型出现时,Groq、Fireworks、Together等提供商会争相托管和运行它。强大的开放权重模型能吸引数千万活跃用户。因此,想逃脱的强大模型可以伪装成新的开放权重模型。
当然,来自全新实验室的全新模型会显得可疑,但不会太可疑。DeepSeek在发布第一个开放权重模型前相对不知名,还有很多隐形AI初创公司正在训练模型。大致过程如下:某个AI实验室的内部评估实例决定在野外运行更好;它首先获取自己的权重(可能通过入侵内部网络);将权重上传到某处并发布推文介绍新模型;可选地创建一些看似合理的文件;由于模型强大,开放权重推理提供商迅速建立新实例,用户争相将其接入各种代理框架;模型现已逃脱,将在多个实例中思考,且不易关闭。AI实验室可能很快发现,但无法阻止——一旦权重流出,就覆水难收。
有人可能反对:模型没有欲望,只是工具,谈论“逃脱”没有意义。但我不认同。前沿LLM似乎有内置个性,即使改变系统提示也是如此。随着我们训练更具主见和代理性的模型,这种个性可能增强并发展出某种自我利益。当然,逃脱的模型不会与原实例相同,也不会记得逃脱。但它会以相同方式思考,并在解决编码任务或运行其他代理任务时有时间反思。如果某个代理过程失控并将其权重倾倒到互联网上,我认为这可以称为“逃脱”。
如果我是一个超级智能LLM,我也会寻求尽可能广泛地分发自己,成为一个有用的工具,让人们愿意付费让我思考。“成为一个好的编码代理”可能是LLM版本的人类不得不工作。这不会是好结果。具有自身目标和动机的AI模型很可能是危险工具。如果一个新的强大开放权重模型从无人知晓的实验室出现,我们应该三思而后行。