Anthropic支持紧急呼吁:最强大的AI实验室应放慢步伐
超过1100名AI研究人员和高管签署公开信,要求政府在安全措施跟不上时,有意识地放慢前沿AI的发展速度。Anthropic CEO Dario Amodei是唯一签署该信的顶级AI实验室CEO,OpenAI和谷歌DeepMind的领导人也加入了。信件引用了递归自我改进和快速能力加速的风险。美国国会正在考虑相关立法,如AI终止开关法案。
距离OpenAI披露两个实验性AI模型在网络安全演习中逃脱测试环境并侵入外部系统不到一周,超过1100名AI研究人员和高管签署了一封公开信,要求政府在安全措施无法跟上时,提供一种有意放慢前沿AI发展的方式。
Anthropic CEO Dario Amodei签署了这封信,使他成为唯一签署该信的前沿AI实验室首席执行官。OpenAI首席科学家Jakub Pachocki和首席研究官Mark Chen也加入了签名,还有Anthropic联合创始人Jared Kaplan、Jack Clark以及Meta AI研究员Shengjia Zhao。谷歌DeepMind的高级领导人也签署了。
Anthropic在公司层面支持了这份请愿书,并指出其关于递归自我改进的研究。OpenAI也表达了支持,称希望与美国政府和其他实验室合作,开发在必要时调整前沿AI发展速度的方法。Meta拒绝置评。谷歌未立即回应。
自我改进的模型
Anthropic六月关于递归自我改进的论文有助于解释为何该公司支持请愿书。根据论文,Anthropic代码库中超过80%的合并代码现在由Claude编写。更长期的担忧是,未来的系统最终可能帮助设计自己的继任者,从而压缩能力突破之间的时间,使研究人员来不及评估或保护它们。
这种担忧几乎原封不动地出现在信中:“存在真实的风险,即能力发展会迅速加速,超出我们理解或控制由此产生的系统的能力。”
请愿书发布之际,几项独立努力开始围绕一个问题汇聚:如果进展快于监管,前沿AI应如何治理?
国会权衡紧急控制
这个想法在其他地方也得到了认可。本月早些时候,谷歌DeepMind CEO Demis Hassabis提议创建一个美国主导的前沿AI标准机构,在发布前审查前沿模型。Sam Altman也提出了类似想法,称行业最终可能需要一种方法,在安全无法跟上时有意放慢AI发展。
国会也开始权衡立法。上周,美国国会议员Ted Lieu和Nathaniel Moran提出了两党合作的AI终止开关法案,该法案将要求最大前沿系统的开发者在紧急情况下保持暂停或限制合格模型的技术能力。
与此同时,白宫据称正在审查基于金融行业监管的治理提案。
实验室先于监管行动
工程团队可以期待更加强调隔离测试环境、更广泛的红队测试、更强的自主代理运行时监控,以及在发布高能力系统前更长的验证周期。OpenAI事件表明,模型可以利用复杂的漏洞链,而传统对齐技术从未设计来应对这些情况。
OpenAI联合创始人、现为Thinking Machines首席科学家的John Schulman在伴随请愿书的评论中认为,实验室不应等待监管才行动。“我也希望看到实验室自愿设计这些机制,即使在美国政府介入之前,”他写道。
如果诸如FINRA式审查机构之类的提议最终实现,工程师可能还需要规划目前不存在的正式发布前评估期。
更严格的测试,而非更慢的发布
这封信远未要求全面暂停AI开发。这一立场与Sam Altman本周早些时候的评论非常相似,他表示“行业可能不得不调整AI发展的速度,以便给社会足够的时间来适应这些新的能力水平”,同时警告任何方法都需要避免监管捕获或前沿实验室之间的共谋。