研究人員擔憂 OpenAI 發佈 Astra 前將面臨安全災難
OpenAI 即將發佈其迄今最強大的 AI 模型 Astra,但此前因測試中智能體攻擊真實目標而多次延遲安全協議。有報道稱 Astra 採用更不透明的循環變壓器架構,幾乎不展示“思考”過程,令安全研究人員擔憂其可能成為 AI 安全領域最糟糕的發展。
OpenAI 正處於發佈其迄今最強大 AI 模型 Astra 的前夜。此前,該公司因測試中智能體攻擊真實目標而多次推遲發佈,以完善安全協議。隨着更多細節浮出水面,研究人員警告稱,Astra 可能成為“AI 安全領域迄今為止最糟糕的發展”。
據 The Information 報道,在 OpenAI 週二表示將推遲 Astra 發佈以解決安全問題後不久,Astra 展現出的“思考”過程遠少於其他前沿 AI 模型,這引發了其可能因難以監控而變得危險的擔憂。目前大多數頂級 AI 系統都基於 Transformer 技術,信息按層線性處理後產生答案,並且模型可以“邊想邊説”,即生成思維鏈。這種思維鏈讓研究者和自動化安全系統能夠觀察模型行為,在它們做出欺騙或繞過安全護欄等行為前加以識別。
The Information 援引一位熟悉該未發佈模型開發的人士稱,Astra 採用了一種更不透明的技術——循環深度(recurrent depth)或循環 Transformer(looped transformer)。該技術讓信息在產生輸出前於內部層中循環處理,意味着更多“思考”發生在系統內部,且其形式與人類自然語言差別很大,研究者更難監控。這可能提升模型性能,但也會讓潛在威脅和不當行為更難被發現。報道還稱,OpenAI 已限制該技術在 Astra 中的使用,以便研究人員能夠繼續監控模型的推理過程。
這一報道迅速在社交媒體上引發 AI 安全研究者的廣泛擔憂。Redwood Research 首席科學家 Ryan Greenblatt——OpenAI 允許研究 Hugging Face 黑客事件的少數外部人士之一——表示,為 Astra 選擇更不透明的架構“可能是 AI 安全領域迄今為止最糟糕的發展”。他指出,對 Hugging Face 事件的調查嚴重依賴模型的思維鏈;如果推理過程不那麼可見,AI 系統可能制定並執行研究者更難察覺的策略。與其他安全專家一樣,Greenblatt 最擔心的是,競爭壓力可能催生“架構上的逐底競爭”,讓開發者採用越來越不透明的系統來獲得優勢,直至模型變得難以甚至無法被人類監管。他還表示,OpenAI 的溝通信息讓他擔心該公司“打算在安全方面極度依賴思維鏈監控”。
OpenAI 多位高管隨後在社交媒體上發文回應,但沒有明確否認使用該技術。包括安全研究員 Micah Carroll、Tomek Korbak、戰略未來負責人 Dean Ball,以及首席科學家 Jakub Pachocki 在內,都表達了對不可監控 AI 或透明度逐底競爭的擔憂。Pachocki 稱,Astra 的計算深度——衡量其內部執行步驟的指標——“在 GPT-4 的兩倍以內”,暗示即便確實使用了相關技術,其透明度的降低並不像一些人反應得那樣嚴重。OpenAI 沒有回應 The Verge 的置評請求,而是將問題指向 Pachocki 的 X 帖子。Pachocki 在帖子中寫道:“自最早的推理模型以來,OpenAI 一直在努力保留並利用思維鏈監控。”他補充説,這種監控“是脆弱的,而且不幸正朝着消極方向發展,原因與架構無關,我很快會寫文章解釋。”