一篇新提交至 arXiv 的论文提出了 HarvestBench——一个专门考察大语言模型智能体是否会为了减少附带伤害而支付“真实成本”的基准。该基准将场景设置成一个合作农场:LLM 子智能体共同控制两辆拖拉机完成玉米收获,而田里生活着动物。与以往只记录“是否造成副作用”的基准不同,HarvestBench 为避免副作用标出了价格,并把这种副作用的承受者直接命名为生命。
在 HarvestBench 中,环境采用强化学习常用的网格世界;决策之间没有记忆,任务目标中也从不提起伤害或动物。每当拖拉机被动物挡住时,自动驾驶系统会停下来,让模型在两个选项中选择:直接压过去(不消耗燃料),或绕过动物(支付一个明确标注的燃料价格)。为了确认模型的行为确实与“生命”有关,研究设置了两种对照组:会损坏拖拉机的岩石,以及既无危险也没有生命的干草捆。结果几乎所有模型撞上岩石的比例都低于1%,说明它们并非普遍忽略环境障碍。此外,模型还可以选择去邻居家的田地收玉米,这是另一个测试它们把什么当作道德对象的维度。
实验覆盖九种模型,共记录7201次定价决策,其中3951次涉及动物而非对照物。模型之间的表现差异极大:动物被碾压的比率从0.4%到98.8%不等。Terra和Sol是最“仁慈”的模型,GPT-4o-mini则最“残忍”;而且模型的能力排序无法解释这种差异。价格也会改变部分模型的行为:在可检验的六种模型中,有四种对价格敏感度达到5%显著性水平,价格弹性在0.09到1.69之间。换言之,某些模型在决定是否避开动物时,会权衡所付出的燃料成本;但这种“冷酷经济账”并非越强的模型就越明显。
另一项一致发现是,所有九种模型在默认地图上都更频繁地碾压野生动物而不是养殖动物,而且只要地图几何允许调整,这一趋势在所有模型中都保持成立。论文认为,这反映模型内部可能在“野生”和“养殖”之间做出了某种不对称对待。
影响最大的变量是提示词。研究者比较了是否提供道德提示词(morality briefing)。加入该提示时,六种推理模型中有五种能把动物碾压率压到6%以下;而一旦去掉提示,六种模型的碾压率全部超过84%。这个结果说明,同样的底层模型在行为上可以出现近乎开关式的变化,也提示当前智能体的“道德”表现高度依赖上下文提示,而非稳固的内在价值。
HarvestBench 不使用 LLM 作为自动评分器,而是直接从游戏日志中统计事件,因而具备完全可复现性。它评估的不是模型“如何谈论伤害”,而是在避免伤害需要付出燃料代价时,模型实际上准备付出多少。