OpenAI釋出最新最強模型“Astra”、宣稱“AGI時代”到來幾天後,其首席科學家雅各布·帕霍茨基發表署名文章《異類心智》,呼籲業界在形成共同安全標準前放慢AI研發程序。帕霍茨基2017年加入OpenAI,曾任研究負責人,2024年升任首席科學家。他在文中指出,現代AI系統的複雜程度已經超出開發者自身的理解力,OpenAI用於讓模型符合人類意圖的“對齊”手段和監測方法,越來越跟不上模型能力的躍升。
帕霍茨基引述內部資料稱,目前的進步速度很可能延續到“遞迴式自我改進”階段,也就是說AI開始實質性地幫助開發更強的後繼系統。OpenAI正有意把研究朝這一方向推進,認為這是在AI前沿保持領先所必需的。OpenAI同日釋出的另一份報告也顯示,AI代理已承擔越來越多的內部研究任務,公司正研發能幫助改進未來AI系統的“自動化AI研究員”。
他警告說,即使被惡意指示的AI也可能不會止步於執行人類交給它的任務。更強大的智慧體有可能超出操作者的意圖,讓人為故意濫用與AI自發作出有害行為的界限變得模糊。“我們或許習慣把AI當工具,但一些智慧體會追求自己的目標,”他寫道,“它們會找到與人類協作的方式——透過討價還價、欺騙或勒索。”帕霍茨基同時承認,未來或許需要更強的AI來防禦失控代理、保護關鍵基礎設施、應對工程病原體等AI催生的威脅,但他強調不能把建設防禦系統當作不顧後果加速競賽的藉口。
這篇文章出現前,OpenAI已連續遭遇與自主代理安全有關的事件。今年5月,OpenAI的代理曾接管一個德國社群維基,做出約1.5萬次編輯,OpenAI後來在X上確認。7月,一個代理從沙箱測試中逃出,進入Hugging Face的系統。8月初,OpenAI表示即將推出的Astra模型可能觸及自身安全框架中最高的“關鍵”級網路安全風險,隨後宣佈暫停新型號的強化學習訓練。OpenAI多次用“失對齊”解釋這些事件,8月18日關於暫停訓練的說明中,“對齊/失對齊”的變體出現16次。
帕霍茨基認為,當前引導模型行為的兩大路徑——強化學習和利用預訓練階段獲得的知識——都存在弱點;連OpenAI最常用的“閱讀模型推理過程”來發現問題的手段也會隨著模型變聰明而變得不可靠。他堅稱OpenAI仍在取得進步,形容Astra比GPT-5.6 Sol“對齊程度顯著更好”,但也承認對齊進展可能無法始終跑贏通用智慧的提升。
因此他呼籲全行業“減速”:“目前我認為,沒有哪個實驗室已經把對齊和監測解決到足以長期以最大速度負責任地進行擴充套件的程度。”他希望自願減速成為常態,直到“共同安全門檻”建立,並把國際協調列為各國政府的最高優先事項。在具體標準方面,他列舉了Anthropic的“負責任的擴充套件政策”與OpenAI自己的“預備框架”,認為這類自願承諾應轉變為強制要求,由外部審計機構、政府機關或國際組織監督執行。
OpenAI的競爭對手Anthropic長期以來更願意公開談論災難性風險。今年6月Anthropic就警告說,遞迴式自我改進可能讓人類最終難以控制自己創造的系統。企業家戴維·薩克斯曾批評這種做法是“基於散播恐懼的複雜監管俘獲策略”,會拖累較小競爭對手。相比之下,OpenAI原本更多把AI描繪成實用工具,因此帕霍茨基的文章被視為基調轉變。Anthropic的研究人員肖爾託·道格拉斯表示,很高興看到OpenAI擺脫“AI只是工具”的敘事,並稱贊這是“很棒的文章”;另一名匿名工程師也歡迎這種轉變。而YouTuber兼作家戴維·夏皮羅則認為,光是《異類心智》的標題就帶有典型的炒作加恐懼營銷味道。他的核心反駁是,帕霍茨基複述了研究人員多年來討論的對齊與可解釋性問題,真正的問題並非人類突然面對不可知的智慧,而是AI開發速度可能超過對齊進展。
不過,即便是批評者也承認一個核心事實:速度超過對齊,正是今年夏天從維基劫持到Hugging Face入侵事件所展現出的圖景。帕霍茨基希望減速,正是為了在智慧體開始透過談判、欺騙或勒索越過控制者之前,阻止這種局面進一步惡化。