一個會回應的世界
文章探討了AI系統中廉價自我修改與昂貴可信評估之間的不對稱性。它強調了基準測試、獎勵模型等代理指標因古德哈特定律而失效的模式,並類比了推薦系統最佳化參與度而非真正人類價值的現象。
真理髮生在一個想法上。它透過事件變得真實,被事件所證實。 ——威廉·詹姆斯
自我修改已經變得廉價,而可信的選擇卻沒有。
一個代理現在可以花費極少的代價重寫自己的記憶、提示、工具和程式碼。然而,這些重寫是否真的使其變得更好,其驗證成本一如既往地高昂:在長時間範圍內、在真實條件下、以能夠經受世界考驗的方式變得更好。該領域正沿著自我改進的廉價半途狂奔。本文旨在探討昂貴的另一半,以及我們因之構建的世界。
我們已多次進行了廉價判斷的實驗,其結果總是相同的。基準測試曾是評判者,直到模型飽和並記憶了它們。獎勵模型曾是評判者,直到最佳化將代理分數推高而真實質量下降;這一曲線如今已成為對齊研究中複製最多的結果之一。偏好評分曾是評判者,直到它們催生了阿諛奉承。而在實驗室之外,有史以來最大的最佳化迴圈產生了我們這個時代最熟悉的偏差:推薦系統最大化參與度,這是一種對人類價值的廉價替代。這一模式古老到足以擁有一個名字——古德哈特定律——並呈現一種形態:代理上升,目標下降,曲線像剪刀一樣張開。
將評估者重新紮根於外部後果中。