AI最喜欢的数字
当要求AI在1到10之间生成随机数时,它倾向于选择7,这与人类的偏见相似。这种偏差源于AI从人类数据中学习。在评估任务中,使用连续评分(如10分制)会受到同样偏差的影响,导致评分失真。本文建议使用二元真假问题来构建评估套件,并通过加权求和得到连续分数,从而避免偏差。此外,可以使用Yeo-Johnson变换等方法来归一化分数分布,提高下游模型的准确性。
当人们被要求说出一个1到10之间的随机数时,大多数人会选择7。这种人类偏见如今在AI身上也得到了体现。研究者发现,当让大型语言模型(LLM)生成1到10之间的随机数时,它们也倾向于输出7,分布与人类行为高度相似。这并非偶然,而是因为LLM基于人类产生的数据进行训练,从而复制了人类材料中的分布偏差。类似的偏差还出现在产品评分中:用户通常给出4颗星(满分5星),导致评分分布呈J形。这种模式在Google餐厅评论和Uber司机评分中也普遍存在。
这种偏差如何影响AI评估?假设你使用LLM-as-a-judge来评估智能体的任务完成质量,并要求模型以10分制打分。你会发现,得到的分数分布并非均匀,而是集中在7分附近——但这并不意味着代码质量优秀,而是反映了模型内部的偏好。实际上,7分可能代表平均水平。一个简单的实验证实了这一点:让LLM对GitHub上的随机代码片段以10分制评分,100个样本的结果显示,分布明显偏向7。不仅如此,如果使用多项选择,LLM还倾向于选择第一个选项,这同样是偏差的表现。
为了解决这个问题,作者建议将评估分解为一系列二元真假问题。例如,在代码评估中,可以问“代码结构是否良好?”、“意图是否清晰?”、“错误处理是否恰当?”。通过为每个问题分配权重并求和,可以得到一个连续分数。这种方法不仅避免了分布偏差,还使评分过程透明且可追溯。实际上,二进制是计算机的基础,包括LLM本身也不例外。最后,作者指出,了解评分分布至关重要。如果需要进一步优化,可以使用Yeo-Johnson变换等工具对分数进行归一化,使其分布平滑,从而为下游模型提供更好的梯度。总之,二元分解和分布控制是构建可靠AI评估系统的关键。