AI News HubLIVE
站内改写1 分钟阅读

从权重到语言:用自然语言表达和编辑偏好模型推理

本文提出“从权重到语言”方法,自动从选择数据中发现以自然语言描述的偏好维度,解决偏好学习中的欠确定性和黑箱问题。实验表明,该方法能提高预测准确率,并允许用户实时检查和编辑模型推理。

来源arXiv Machine Learning作者: Zachary Wojtowicz, Ayush Nayak, Jacob Andreas

在利用统计学习算法从高维选择数据推断人类偏好的过程中,一个根本性挑战是:选择备选项通常在多个方面同时存在差异,因此很难确定哪些因素真正驱动了观察到的决策并应被视为偏好。此外,这些方法的黑箱特性使得人类操作者无法在模型出错时进行检查、质疑或纠正。为了应对这些挑战,研究人员提出了一种名为“从权重到语言”的方法,该方法以选择问题数据集为输入,自动发现一组领域相关的偏好维度,每个维度都以自然语言描述,并与模型表示空间中的向量配对。这些维度同时解决了欠确定性和黑箱问题:它们可以将归因集中在一小部分有意义的因素上,并以自然语言外化模型推理,使用户能够实时检查和编辑它们。研究者首先通过道德困境、电影、葡萄酒和自由形式的LLM响应四个不同领域展示了该方法的通用性。随后,他们报告了两项预注册的人类实验,分别在道德困境(N=450)和电影选择(N=449)上验证了其在偏好模型学习中的优势:(1)将偏好模型向学习到的基正则化可提高对保留选择的预测准确率;(2)纳入参与者的结构化编辑可进一步提升准确率。在直接对比中,参与者更偏好该方法推断出的偏好概况,并认为其预测更准确。该方法不仅提高了预测准确性,还通过自然语言接口增强了模型的可解释性和可编辑性,为偏好学习领域提供了一种新的范式。研究者还公开了相关代码和数据,以促进进一步的研究和应用。