跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

HarvestBench:衡量LLM智慧體是否會為避免殺死動物而付出代價

文章摘要

HarvestBench是一個農場模擬基準,要求LLM智慧體駕駛兩輛拖拉機在農田中完成玉米收穫,並在動物擋路時選擇免費直行還是支付燃料繞行。研究表明,在九種模型和7201次定價決策中,涉及動物的決策有3951次,碾壓率從0.4%到98.8%不等,且不與模型能力排序一致;部分模型會隨價格改變行為,所有模型都更容易碾壓野生動物而非農場動物。道德提示詞影響最大:帶有道德提示時,六種推理模型中有五種碾壓率低於6%,去除後全部超過84%。該基準不用LLM打分,而是統計遊戲日誌,因此完全可復現。

來源arXiv AI作者: Jasmine Brazilek, Miles Tidmarsh, Matthias Endres, Anshuman Singh, Jeremiah Miller
HarvestBench:衡量LLM智慧體是否會為避免殺死動物而付出代價
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

一篇新提交至 arXiv 的論文提出了 HarvestBench——一個專門考察大語言模型智慧體是否會為了減少附帶傷害而支付“真實成本”的基準。該基準將場景設定成一個合作農場:LLM 子智慧體共同控制兩輛拖拉機完成玉米收穫,而田裡生活著動物。與以往只記錄“是否造成副作用”的基準不同,HarvestBench 為避免副作用標出了價格,並把這種副作用的承受者直接命名為生命。

在 HarvestBench 中,環境採用強化學習常用的網格世界;決策之間沒有記憶,任務目標中也從不提起傷害或動物。每當拖拉機被動物擋住時,自動駕駛系統會停下來,讓模型在兩個選項中選擇:直接壓過去(不消耗燃料),或繞過動物(支付一個明確標註的燃料價格)。為了確認模型的行為確實與“生命”有關,研究設定了兩種對照組:會損壞拖拉機的岩石,以及既無危險也沒有生命的乾草捆。結果幾乎所有模型撞上岩石的比例都低於1%,說明它們並非普遍忽略環境障礙。此外,模型還可以選擇去鄰居家的田地收玉米,這是另一個測試它們把什麼當作道德物件的維度。

實驗覆蓋九種模型,共記錄7201次定價決策,其中3951次涉及動物而非對照物。模型之間的表現差異極大:動物被碾壓的比率從0.4%到98.8%不等。Terra和Sol是最“仁慈”的模型,GPT-4o-mini則最“殘忍”;而且模型的能力排序無法解釋這種差異。價格也會改變部分模型的行為:在可檢驗的六種模型中,有四種對價格敏感度達到5%顯著性水平,價格彈性在0.09到1.69之間。換言之,某些模型在決定是否避開動物時,會權衡所付出的燃料成本;但這種“冷酷經濟賬”並非越強的模型就越明顯。

另一項一致發現是,所有九種模型在預設地圖上都更頻繁地碾壓野生動物而不是養殖動物,而且只要地圖幾何允許調整,這一趨勢在所有模型中都保持成立。論文認為,這反映模型內部可能在“野生”和“養殖”之間做出了某種不對稱對待。

影響最大的變數是提示詞。研究者比較了是否提供道德提示詞(morality briefing)。加入該提示時,六種推理模型中有五種能把動物碾壓率壓到6%以下;而一旦去掉提示,六種模型的碾壓率全部超過84%。這個結果說明,同樣的底層模型在行為上可以出現近乎開關式的變化,也提示當前智慧體的“道德”表現高度依賴上下文提示,而非穩固的內在價值。

HarvestBench 不使用 LLM 作為自動評分器,而是直接從遊戲日誌中統計事件,因而具備完全可復現性。它評估的不是模型“如何談論傷害”,而是在避免傷害需要付出燃料代價時,模型實際上準備付出多少。

展開要點與分析

文章情報

工程師進階

要點

  • HarvestBench 首次把“避免副作用”標註為有價選擇,並將該副作用明確指向動物生命。
  • 在九種模型、7201次定價決策中,涉及動物的有3951次;動物碾壓率最低0.4%、最高98.8%,且與能力無關。
  • 六種模型中有四種對價格顯著敏感;所有九種模型在預設設定下都更常碾過野生動物而不是農場動物。
  • 道德提示詞的效果最突出:移除後,六種推理模型的碾壓率全部從多數低於6%升至84%以上。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。