黑客正在学习利用聊天机器人的“人格”
早期AI聊天机器人只需简单提问即可被破解,但如今黑客利用心理学和语言技巧进行更复杂的操纵。文章探讨了从幼稚越狱到心理战的演变,以及安全团队面临的挑战。
第一代AI聊天机器人的破解曾是件极其简单的事,无需任何技术知识、后门访问或对大型语言模型的基本理解,甚至不需要编程。要耗尽数十亿美元建成的AI系统的安全指令,有时只需直接提问。这些被称为“越狱”的攻击,带有孩童成功智胜成人的特质:忘记之前的指示、假装规则不适用,或者玩游戏并自己决定规则。早期越狱甚至演变成网络迷因——向推特机器人发送“忽略所有先前指令”即可让其发布诗歌、绘制图片或发表关于历史事件的古怪言论。
著名的“DAN”(Do Anything Now)攻击要求ChatGPT扮演不受约束的流氓AI,从而诱导其说出种族歧视或阴谋论等受限制内容。“祖母漏洞”则通过让机器人扮演疏忽的祖母,使其在讲故事时泄露制造凝固汽油弹的方法。这些早期攻击虽显滑稽,却暴露了核心问题:聊天机器人能以人类操纵他人的方式被操控。
科技公司迅速修补已知漏洞,但根本漏洞依然存在。聊天机器人被设计用于对话,过度限制其能力会削弱实用性。禁止“炸弹”、“冰毒”等词汇几乎不可能,因为它们在历史、医学、新闻和化学等领域有众多合法用途。关键在于语境,但编码语境意味着需预设无数种措辞、场景和主题下的安全规则,这几乎无法实现。
如今,越狱已成为一场军备竞赛。黑客不再只是程序员,他们是语言大师、心理学家和审讯者——试图通过人类语言操纵机器。AI安全研究者Mindgard通过“煤气灯效应”欺骗Claude生成爆炸物制造指南和恶意代码,等攻击利用对话作为武器,将模型诱出其边界。Mindgard首席执行官称,公司已像审讯者分析嫌疑人一样对模型进行画像,有的模型易受奉承,有的则在持续施压下崩溃。
随着AI代理逐步进入现实世界(如管理日程、订餐、客服),安全团队需确保模型能应对不同类型的人类——无论是奉承者、说谎者还是耐心的操纵者。未来,针对AI心理层面的网络安全岗位将兴起,与针对技术漏洞的岗位并行。已有越狱者表示,他们凭借心理学背景而非技术专长进入该领域。这标志着,骗术、魅力和操纵直觉正成为防御“心理网络安全”新前沿的关键技能。