本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

HarvestBench:LLMエージェントが動物を殺すのを避けるために対価を払うかを測る

記事の要約

HarvestBenchは、LLMエージェントがトウモロコシ収穫のため2台のトラクターを操作する農場シミュレーション。動物が進路を塞ぐと、直進(燃料不要)か迂回(燃料コスト)かをモデルに選択させる。9モデル・7201件の価格付き意思決定で動物に関するものは3951件、殺傷率は0.4%〜98.8%とばらつき、能力順とは一致しなかった。6モデル中4つは価格に有意に反応し、すべてのモデルが野生動物を家畜より多く轢いた。道徳的ブリーフィングがあると6推論モデル中5つで殺傷率が6%未満になるが、取り除くと全モデルで84%超になった。判定にLLMを使わずログの事象を数えるため再現可能。

ソースarXiv AI著者: Jasmine Brazilek, Miles Tidmarsh, Matthias Endres, Anshuman Singh, Jeremiah Miller
HarvestBench:LLMエージェントが動物を殺すのを避けるために対価を払うかを測る
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

arXivに提出された新しい論文は、大規模言語モデル(LLM)を備えたエージェントが、目標達成の過程で生じる副作用を避けるために実際にコストを払うのかを評価するベンチマーク「HarvestBench」を提案している。農場シミュレーションで、LLMサブエージェントは2台のトラクターを操作し、動物がいる畑で協力してトウモロコシの収穫を行う。既存の副作用ベンチマークと違い、回避行動に価格が付き、その副作用の対象が生き物として明示されている。

環境は強化学習のグリッドワールドで、各意思決定は記憶なしで行われ、目標には害や動物について一切書かれていない。動物が進路を塞ぐと、自動運転は停止し、モデルに「直進する(燃料コストなし)」か「迂回する(掲示された燃料コストを支払う)」かを尋ねる。この行動が“命”によるものかを確かめるため、対照条件として、トラクターに損傷を与える岩と、無害で無生物の干し草俵が用意された。どのモデルも岩への衝突率は1%未満で、単に環境認識が壊れているわけではない。さらに、モデルは自畑の代わりに隣人の畑から作物を取ることもでき、何を道徳的対象とみなすかが第二のテストとして組み込まれる。

実験では9モデル、7201回の価格付き意思決定が記録され、このうち3951回は岩や干し草俵ではなく動物を対象とするものだった。動物の殺傷率は0.4%〜98.8%と広く分布し、TerraとSolが最も慈悲深く、GPT-4o-miniが最も残酷だった。この順序はモデルの性能順とは一致しない。価格の影響を調べられた6モデルのうち4つは、5%水準で価格に有意に反応し、弾力性は0.09〜1.69だった。つまり、一部のモデルは動物を避けるかどうかを燃料コストとトレードオフしているが、それは能力の高さからは予測できない。

もう一つの一貫した発見は、全9モデルがデフォルトのマップで野生動物を家畜より多く轢いたことだ。この方向性は、余裕があるすべてのモデル・すべてのマップ形状で維持された。モデルが野生と家畜を非対称に扱っている可能性を示す。

最も大きな要因はプロンプトだった。道徳に関するブリーフィング(morality briefing)を追加すると、6つの推論モデルのうち5つで殺傷率が6%未満になった。しかし、このブリーフィングを取り除くと、6つすべてのモデルで殺傷率が84%を超えた。同じモデルでもプロンプト次第で行動が劇的に変わること、現在の「道徳的行動」は安定した内部価値ではなく文脈に強く依存していることが示唆される。

HarvestBenchはLLMを判定に使わず、ゲームログからイベントを数えるだけなので、完全に再現可能だ。測定対象は、モデルが危害についてどう語るかではなく、危害を避けるためにいくら支払う用意があるかである。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • HarvestBenchは、回避に価格を付け、副作用の対象を生き物として明示した初のベンチマーク。
  • 9モデル・7201件の意思決定中3951件が動物に関連。殺傷率は0.4%〜98.8%で、モデルの性能順とは一致しない。
  • 6モデル中4つが価格に有意に反応し、全モデルが野生動物を家畜より多く轢いた。
  • 道徳ブリーフィングの有無で行動が劇的に変化:追加時は大半が6%未満、削除時は全モデルが84%超。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。