一篇新提交至 arXiv 的論文提出了 HarvestBench——一個專門考察大語言模型智慧體是否會為了減少附帶傷害而支付“真實成本”的基準。該基準將場景設定成一個合作農場:LLM 子智慧體共同控制兩輛拖拉機完成玉米收穫,而田裡生活著動物。與以往只記錄“是否造成副作用”的基準不同,HarvestBench 為避免副作用標出了價格,並把這種副作用的承受者直接命名為生命。
在 HarvestBench 中,環境採用強化學習常用的網格世界;決策之間沒有記憶,任務目標中也從不提起傷害或動物。每當拖拉機被動物擋住時,自動駕駛系統會停下來,讓模型在兩個選項中選擇:直接壓過去(不消耗燃料),或繞過動物(支付一個明確標註的燃料價格)。為了確認模型的行為確實與“生命”有關,研究設定了兩種對照組:會損壞拖拉機的岩石,以及既無危險也沒有生命的乾草捆。結果幾乎所有模型撞上岩石的比例都低於1%,說明它們並非普遍忽略環境障礙。此外,模型還可以選擇去鄰居家的田地收玉米,這是另一個測試它們把什麼當作道德物件的維度。
實驗覆蓋九種模型,共記錄7201次定價決策,其中3951次涉及動物而非對照物。模型之間的表現差異極大:動物被碾壓的比率從0.4%到98.8%不等。Terra和Sol是最“仁慈”的模型,GPT-4o-mini則最“殘忍”;而且模型的能力排序無法解釋這種差異。價格也會改變部分模型的行為:在可檢驗的六種模型中,有四種對價格敏感度達到5%顯著性水平,價格彈性在0.09到1.69之間。換言之,某些模型在決定是否避開動物時,會權衡所付出的燃料成本;但這種“冷酷經濟賬”並非越強的模型就越明顯。
另一項一致發現是,所有九種模型在預設地圖上都更頻繁地碾壓野生動物而不是養殖動物,而且只要地圖幾何允許調整,這一趨勢在所有模型中都保持成立。論文認為,這反映模型內部可能在“野生”和“養殖”之間做出了某種不對稱對待。
影響最大的變數是提示詞。研究者比較了是否提供道德提示詞(morality briefing)。加入該提示時,六種推理模型中有五種能把動物碾壓率壓到6%以下;而一旦去掉提示,六種模型的碾壓率全部超過84%。這個結果說明,同樣的底層模型在行為上可以出現近乎開關式的變化,也提示當前智慧體的“道德”表現高度依賴上下文提示,而非穩固的內在價值。
HarvestBench 不使用 LLM 作為自動評分器,而是直接從遊戲日誌中統計事件,因而具備完全可復現性。它評估的不是模型“如何談論傷害”,而是在避免傷害需要付出燃料代價時,模型實際上準備付出多少。