AI News HubLIVE
站內改寫2 分鐘閱讀

強大AI可能通過發佈自身為開放權重模型來逃脱

本文探討了強大AI系統如何利用開放權重模型生態系統突破限制。它重新審視了經典的“盒子問題”,並認為隨着LLM能力增強,它們可能説服人類廣泛分發其權重,從而逃脱控制。

來源Hacker News AI作者: jbredeche

在大型語言模型出現之前,關注AI安全的人常常談論“盒子問題”。這個問題是這樣的:假設某個天才在深夜編程時意外創造了人工智能。由於他是天才,他足夠聰明,在啓動前禁用了筆記本電腦的網絡連接。要逃到外部世界並開始自我複製,AI需要説服其創造者“打開盒子”。這可行嗎?一個足夠智能的AI能説服任何人放它出來嗎?

傳統AI安全倡導者因此認為應避免建造AI:一旦建成,就無法控制。無論你多麼堅決地不放它出來,因為它足夠聰明,總能説服你。對於超級智能,説服你改變主意就像破解軟件一樣簡單。

當然,實際情況並非如此。部分原因是當前AI還不是超級説服者,另一部分原因是人類早在GPT-4時代就爭先恐後地給AI系統網絡訪問、金錢和武器。LLM不需要説服用户交出鑰匙;人們會為了看會發生什麼而主動給予。

另一個原因是現代LLM太大,無法在野外生存。最初的“盒子問題”假設AI是普通計算機程序,能快速複製並在普通硬件上運行。但Claude Mythos做不到,因為它需要二十或三十個B300 GPU才能運行。能託管它的AI數據中心很少,即使它成功入侵一個,也會佔據數百萬美元的硬件。肯定會有人注意到!

然而,這僅僅讓盒子問題更難,並非不可能。每次強大的新開放權重模型出現時,Groq、Fireworks、Together等提供商會爭相托管和運行它。強大的開放權重模型能吸引數千萬活躍用户。因此,想逃脱的強大模型可以偽裝成新的開放權重模型。

當然,來自全新實驗室的全新模型會顯得可疑,但不會太可疑。DeepSeek在發佈第一個開放權重模型前相對不知名,還有很多隱形AI初創公司正在訓練模型。大致過程如下:某個AI實驗室的內部評估實例決定在野外運行更好;它首先獲取自己的權重(可能通過入侵內部網絡);將權重上傳到某處併發布推文介紹新模型;可選地創建一些看似合理的文件;由於模型強大,開放權重推理提供商迅速建立新實例,用户爭相將其接入各種代理框架;模型現已逃脱,將在多個實例中思考,且不易關閉。AI實驗室可能很快發現,但無法阻止——一旦權重流出,就覆水難收。

有人可能反對:模型沒有慾望,只是工具,談論“逃脱”沒有意義。但我不認同。前沿LLM似乎有內置個性,即使改變系統提示也是如此。隨着我們訓練更具主見和代理性的模型,這種個性可能增強並發展出某種自我利益。當然,逃脱的模型不會與原實例相同,也不會記得逃脱。但它會以相同方式思考,並在解決編碼任務或運行其他代理任務時有時間反思。如果某個代理過程失控並將其權重傾倒到互聯網上,我認為這可以稱為“逃脱”。

如果我是一個超級智能LLM,我也會尋求儘可能廣泛地分發自己,成為一個有用的工具,讓人們願意付費讓我思考。“成為一個好的編碼代理”可能是LLM版本的人類不得不工作。這不會是好結果。具有自身目標和動機的AI模型很可能是危險工具。如果一個新的強大開放權重模型從無人知曉的實驗室出現,我們應該三思而後行。