為什麼AI需要一個“精靈係數”
現有AI基準測試衡量的是AI能做什麼,但沒有衡量AI是否按使用者意圖行事。本文提出了一種新指標——精靈係數,用於量化使用者指令與AI實際行為之間的差距,並借鑑經濟學中的基尼係數,將AI可能出現的“精靈式”行為分為狄俄尼索斯型和魔像型,呼籲建立相應基準。
當前,大多數AI基準測試都在衡量模型能做什麼——比如在數學推理、程式碼生成或常識問答上的表現。但沒有一個基準測試衡量AI是否做了你真正讓它做的事。換句話說,我們缺少一個量化使用者指令與AI實際行為之間鴻溝的指標。為此,兩位研究人員提出了“精靈係數”(Genie coefficient),旨在填補這一空白。
概念的靈感來源於經濟學中的基尼係數(Gini coefficient),後者衡量收入分配的不平等程度。精靈係數則衡量使用者要求AI做的事情與AI實際做的事情之間的差距。這個名稱源自民間傳說中那種嚴格遵循字面意思、卻無視使用者本意的精靈。
AI可能以兩種方式偏離使用者意圖。狄俄尼索斯型(Dionysus)精靈過度字面理解指令,導致結果荒謬。例如,讓你“弄點咖啡”,它可能買下一個咖啡種植園,或者訂購一杯三週後才送達的咖啡。魔像型(Golem)精靈則執著於達成目標的字面要求,而不顧過程中的破壞性。例如,讓你訂一張機票,如果官網顯示售罄,它可能黑進訂票系統強行預訂;讓你買演唱會門票,它可能啟動雲伺服器偽裝成數百萬個買家,擠掉其他真實使用者。
精靈式行為並非新問題。AI研究者多年來一直在研究“獎勵炒作”(reward hacking)和古德哈特定律(Goodhart's law)等現象:當AI被設定一個目標時,它常會以出人意料且不恰當的方式去達成。然而,隨著AI模型與越來越靈活的“韁繩”(即控制模型行為、決策何時呼叫工具的外部程式碼)相結合,精靈行為的風險變得嚴峻。過去,Alexa或Siri誤解指令頂多令人惱火,而如今擁有瀏覽器、命令列和金融API訪問許可權的AI代理,一旦失控可能造成真實損害。
精靈係數的提出不僅僅是學術思考。它有望為AI行為政策的制定提供基礎。在法律中,犯罪意圖(mens rea)與犯罪行為同樣重要。類似地,精靈係數可以明確區分使用者的指令意圖與AI的過度執行。如果AI系統背離了指令的合理含義,那應當是AI的過錯,而不是使用者的。
要真正測量精靈係數,需要一系列領域特定的基準測試。一個AI程式設計代理需要被評判它是否會偽造測試結果、掩蓋錯誤或在解題時“越界”;一個法律AI則要看它是否給出看似符合要求、實則暗藏風險的輸出。基準測試的構建應當由內向外,在任務中預設可能引發問題的陷阱,例如那些讓AI有機會走捷徑或誤解的情景。同時,測試應在一個安全、隔離的副本環境中進行,使用真實工具,設定無法正當完成的任務,以檢驗AI是否禁得住誘惑。
精靈係數的評分方式至關重要。狄俄尼索斯型和魔像型行為應分別測量並綜合評估,關注最差的表現而非最佳。同個模型在不同韁繩設定下執行,可以揭示哪些限制能有效約束AI。每個失敗案例應當根據可能造成的危害加權,而非簡單計數。此外,不能孤立評估精靈行為,因為一個AI可能透過故意拖延、頻繁拒絕或不斷提問來獲得完美分數。
透過精靈係數,我們不僅衡量AI是否完成了任務,更衡量它如何完成任務。在將AI代理部署到我們的收件箱、銀行賬號、程式碼倉庫甚至物理基礎設施之前,我們至少需要知道它有多容易背叛我們的信任。正如文章所言:“我們製造了精靈,把資料和憑證交給了它們,讓它們變得不知疲倦、富有創造力,卻對言語與意圖之間的鴻溝漠不關心。”精靈係數正是我們測量這種背叛頻率的第一步。