AI News HubLIVE
站內改寫2 分鐘閱讀

駭客正在學習利用聊天機器人的“人格”

早期AI聊天機器人只需簡單提問即可被破解,但如今駭客利用心理學和語言技巧進行更復雜的操縱。文章探討了從幼稚越獄到心理戰的演變,以及安全團隊面臨的挑戰。

來源The Verge AI作者: Robert Hart

第一代AI聊天機器人的破解曾是件極其簡單的事,無需任何技術知識、後門訪問或對大型語言模型的基本理解,甚至不需要程式設計。要耗盡數十億美元建成的AI系統的安全指令,有時只需直接提問。這些被稱為“越獄”的攻擊,帶有孩童成功智勝成人的特質:忘記之前的指示、假裝規則不適用,或者玩遊戲並自己決定規則。早期越獄甚至演變成網路迷因——向推特機器人傳送“忽略所有先前指令”即可讓其釋出詩歌、繪製圖片或發表關於歷史事件的古怪言論。

著名的“DAN”(Do Anything Now)攻擊要求ChatGPT扮演不受約束的流氓AI,從而誘導其說出種族歧視或陰謀論等受限制內容。“祖母漏洞”則透過讓機器人扮演疏忽的祖母,使其在講故事時洩露製造凝固汽油彈的方法。這些早期攻擊雖顯滑稽,卻暴露了核心問題:聊天機器人能以人類操縱他人的方式被操控。

科技公司迅速修補已知漏洞,但根本漏洞依然存在。聊天機器人被設計用於對話,過度限制其能力會削弱實用性。禁止“炸彈”、“冰毒”等詞彙幾乎不可能,因為它們在歷史、醫學、新聞和化學等領域有眾多合法用途。關鍵在於語境,但編碼語境意味著需預設無數種措辭、場景和主題下的安全規則,這幾乎無法實現。

如今,越獄已成為一場軍備競賽。駭客不再只是程式設計師,他們是語言大師、心理學家和審訊者——試圖透過人類語言操縱機器。AI安全研究者Mindgard透過“煤氣燈效應”欺騙Claude生成爆炸物製造指南和惡意程式碼,等攻擊利用對話作為武器,將模型誘出其邊界。Mindgard執行長稱,公司已像審訊者分析嫌疑人一樣對模型進行畫像,有的模型易受奉承,有的則在持續施壓下崩潰。

隨著AI代理逐步進入現實世界(如管理日程、訂餐、客服),安全團隊需確保模型能應對不同型別的人類——無論是奉承者、說謊者還是耐心的操縱者。未來,針對AI心理層面的網路安全崗位將興起,與針對技術漏洞的崗位並行。已有越獄者表示,他們憑藉心理學背景而非技術專長進入該領域。這標誌著,騙術、魅力和操縱直覺正成為防禦“心理網路安全”新前沿的關鍵技能。