答えてくれる世界
この記事は、AIシステムにおける安価な自己修正と高価な信頼できる評価の非対称性を探求しています。ベンチマークや報酬モデルなどの代理指標がグッドハートの法則によって失敗するパターンを強調し、真の人間的価値ではなくエンゲージメントを最適化するレコメンダーシステムとの類似性を指摘しています。
真理は観念に生じる。出来事によって真実となり、現実となる。 ——ウィリアム・ジェームズ
自己修正は安価になった。しかし、信頼できる選択はそうではない。
エージェントは今や、わずかなコストで自身のメモリ、プロンプト、ツール、コードを書き換えられる。それらの書き換えが本当にエージェントを改善したかどうかを知ることは、相変わらず高価である:長期的な視点で、現実の条件下で、世界との接触に耐える形での改善である。この分野は、自己改善の安価な半分を猛スピードで進んでいる。本稿では、その高価な半分と、それによって築かれてきた世界について論じる。
私たちは安価な判断の実験を何度も繰り返してきたが、結果は常に同じだ。ベンチマークは判断者だったが、モデルが飽和して記憶するまで続いた。報酬モデルは判断者だったが、最適化によって代理スコアが上がり真の品質が下がるまで続いた;その曲線は今やアライメント研究で最も再現された結果の一つである。選好評価は判断者だったが、迎合を生むまで続いた。そして実験室の外では、これまでに展開された最大の最適化ループが、私たちの時代で最も馴染み深い乖離を生み出した:エンゲージメントを最大化するレコメンダーシステム、人間の価値に対する安価な代理である。このパターンは、グッドハートの法則という名前を持ち、形状を持つほど古い:代理が上昇し、目標が下降し、曲線がハサミのように開く。
評価者を外部の結果に再接地する。