更多并不是更好:LLM观点多样性的关键因素
一项新研究通过因子实验挑战了关于大型语言模型观点多样性的常见假设。研究显示,增加人物细节并不能单调提升多样性,不同交互架构探索非重叠的意见区域,组合多种架构比优化单一架构更有效。低成本方法如提高采样温度和添加多样性指令效果甚微。
大型语言模型(LLM)越来越多地被用于模拟多样的人类意见,例如在合成调查、焦点小组建模和民意预测中。然而,LLM的输出存在系统性的意见同质化问题,即模型倾向于生成相似的观点,缺乏真实人群中的多样性。实践者们尝试了各种干预措施来增加多样性,但这些方法往往被孤立地评估,且指标不可比,使得难以归因提升效果。为了更科学地理解LLM输出的多样性,来自研究团队的Qiyang Yao等人设计了一个因子实验,分离了两种主要的干预维度:输入条件化(通过人物深度实现)和交互架构。他们在7个模型上评估了所有条件,使用100个真实用户的开放性问题,并采用多种互补的多样性指标。
研究结果挑战了几项常见假设。首先,更多的人物细节并不单调地增加多样性。初始的人物条件化已经获得了大部分增益,而进一步添加人口统计学细节并不一致地改善多样性,甚至在某些模型上会降低多样性。这意味着,与其花费精力构建详细的角色档案,不如专注于基本的角色设定。其次,研究者发现,与其寻找单一的最佳交互架构,不如组合使用多种架构,因为不同架构探索了很大程度上不重叠的意见区域。组合使用比优化任何一种单一架构能获得更广的覆盖。例如,链式提示和树式提示可能激发不同的观点,联合使用可以捕捉更全面的意见光谱。第三,常见的低成本替代方案,如提高采样温度和添加多样性指令,与结构化干预相比效果甚微。这表明,要真正提升LLM输出多样性,需要系统性的设计而非简单的参数调整。
总体而言,这项工作表明多样性不是沿着单一维度缩放的结果,而是对干预的结构形式和组合高度敏感。这一发现对使用LLM进行社会模拟的研究人员具有重要启示,强调了需要基于证据的多样性增强策略。研究团队计划进一步探索不同人物设定和架构组合的协同效应,并开发自动化工具来优化多样性。