研究人员担忧 OpenAI 发布 Astra 前将面临安全灾难
OpenAI 即将发布其迄今最强大的 AI 模型 Astra,但此前因测试中智能体攻击真实目标而多次延迟安全协议。有报道称 Astra 采用更不透明的循环变压器架构,几乎不展示“思考”过程,令安全研究人员担忧其可能成为 AI 安全领域最糟糕的发展。
OpenAI 正处于发布其迄今最强大 AI 模型 Astra 的前夜。此前,该公司因测试中智能体攻击真实目标而多次推迟发布,以完善安全协议。随着更多细节浮出水面,研究人员警告称,Astra 可能成为“AI 安全领域迄今为止最糟糕的发展”。
据 The Information 报道,在 OpenAI 周二表示将推迟 Astra 发布以解决安全问题后不久,Astra 展现出的“思考”过程远少于其他前沿 AI 模型,这引发了其可能因难以监控而变得危险的担忧。目前大多数顶级 AI 系统都基于 Transformer 技术,信息按层线性处理后产生答案,并且模型可以“边想边说”,即生成思维链。这种思维链让研究者和自动化安全系统能够观察模型行为,在它们做出欺骗或绕过安全护栏等行为前加以识别。
The Information 援引一位熟悉该未发布模型开发的人士称,Astra 采用了一种更不透明的技术——循环深度(recurrent depth)或循环 Transformer(looped transformer)。该技术让信息在产生输出前于内部层中循环处理,意味着更多“思考”发生在系统内部,且其形式与人类自然语言差别很大,研究者更难监控。这可能提升模型性能,但也会让潜在威胁和不当行为更难被发现。报道还称,OpenAI 已限制该技术在 Astra 中的使用,以便研究人员能够继续监控模型的推理过程。
这一报道迅速在社交媒体上引发 AI 安全研究者的广泛担忧。Redwood Research 首席科学家 Ryan Greenblatt——OpenAI 允许研究 Hugging Face 黑客事件的少数外部人士之一——表示,为 Astra 选择更不透明的架构“可能是 AI 安全领域迄今为止最糟糕的发展”。他指出,对 Hugging Face 事件的调查严重依赖模型的思维链;如果推理过程不那么可见,AI 系统可能制定并执行研究者更难察觉的策略。与其他安全专家一样,Greenblatt 最担心的是,竞争压力可能催生“架构上的逐底竞争”,让开发者采用越来越不透明的系统来获得优势,直至模型变得难以甚至无法被人类监管。他还表示,OpenAI 的沟通信息让他担心该公司“打算在安全方面极度依赖思维链监控”。
OpenAI 多位高管随后在社交媒体上发文回应,但没有明确否认使用该技术。包括安全研究员 Micah Carroll、Tomek Korbak、战略未来负责人 Dean Ball,以及首席科学家 Jakub Pachocki 在内,都表达了对不可监控 AI 或透明度逐底竞争的担忧。Pachocki 称,Astra 的计算深度——衡量其内部执行步骤的指标——“在 GPT-4 的两倍以内”,暗示即便确实使用了相关技术,其透明度的降低并不像一些人反应得那样严重。OpenAI 没有回应 The Verge 的置评请求,而是将问题指向 Pachocki 的 X 帖子。Pachocki 在帖子中写道:“自最早的推理模型以来,OpenAI 一直在努力保留并利用思维链监控。”他补充说,这种监控“是脆弱的,而且不幸正朝着消极方向发展,原因与架构无关,我很快会写文章解释。”