從權重到語言:用自然語言表達和編輯偏好模型推理
本文提出“從權重到語言”方法,自動從選擇資料中發現以自然語言描述的偏好維度,解決偏好學習中的欠確定性和黑箱問題。實驗表明,該方法能提高預測準確率,並允許使用者即時檢查和編輯模型推理。
在利用統計學習演算法從高維選擇資料推斷人類偏好的過程中,一個根本性挑戰是:選擇備選項通常在多個方面同時存在差異,因此很難確定哪些因素真正驅動了觀察到的決策並應被視為偏好。此外,這些方法的黑箱特性使得人類操作者無法在模型出錯時進行檢查、質疑或糾正。為了應對這些挑戰,研究人員提出了一種名為“從權重到語言”的方法,該方法以選擇問題資料集為輸入,自動發現一組領域相關的偏好維度,每個維度都以自然語言描述,並與模型表示空間中的向量配對。這些維度同時解決了欠確定性和黑箱問題:它們可以將歸因集中在一小部分有意義的因素上,並以自然語言外化模型推理,使使用者能夠即時檢查和編輯它們。研究者首先透過道德困境、電影、葡萄酒和自由形式的LLM響應四個不同領域展示了該方法的通用性。隨後,他們報告了兩項預註冊的人類實驗,分別在道德困境(N=450)和電影選擇(N=449)上驗證了其在偏好模型學習中的優勢:(1)將偏好模型向學習到的基正則化可提高對保留選擇的預測準確率;(2)納入參與者的結構化編輯可進一步提升準確率。在直接對比中,參與者更偏好該方法推斷出的偏好概況,並認為其預測更準確。該方法不僅提高了預測準確性,還透過自然語言介面增強了模型的可解釋性和可編輯性,為偏好學習領域提供了一種新的正規化。研究者還公開了相關程式碼和資料,以促進進一步的研究和應用。