行動の前に:LLMの将来的仮説発見に関するベンチマーク
大規模言語モデル(LLM)は事前に指定された質問への回答に優れているが、結論が出る前のオープンエンドな発見段階を探索する能力はほとんど測定されていない。本論文は、不確定な証拠からモデルが自律的に根拠のある、識別可能かつ検証可能な仮説空間を構築する「将来的仮説発見(PHD)」を導入する。この能力を評価するために、6つの科学・分析領域にわたる988事例のHypoDataデータセットとHypoEval評価フレームワークからなるHypoArenaベンチマークを構築。15の最先端LLMでの実験により、明確な能力の階層化と構造化分析スキルのモデル依存効果が明らかになり、一部の低性能モデルでは向上が見られたが、トップモデルを含む他のシステムでは後退が見られた。
大規模言語モデル(LLM)は、あらかじめ指定された質問に答えることに優れていますが、結論が出る前のオープンエンドな発見段階を自律的に探索する能力は、ほとんど測定されていません。このギャップを埋めるために、研究チームは「将来的仮説発見(PHD)」タスクを導入しました。これは、異常な観測や断片的な記録などの不確定な証拠から、モデルが自律的に根拠のある、識別可能かつ検証可能な仮説空間を構築し、その後の調査を導くことを要求するものです。
この能力を体系的に評価するために、研究者らはHypoArenaベンチマークスイートを開発しました。これは2つの主要コンポーネントから構成されます:HypoData(6つの科学・分析領域にわたる988の事例を含むベンチマークデータセット)とHypoEval(オープンエンドな仮説セットを評価するためのフレームワーク)です。大規模にHypoDataを構築するために、チームは「回顧的コンテキスト回帰」と呼ばれる手法を提案しました。これは、完成した専門家文書から明示的な結論、目標仮説、および回顧的因果帰属を除去し、事実の基盤を保持することで、結論前のコンテキストを再構築する「鍛造・監査」パイプラインです。
PHDタスクは複数の有効な出力を許容するため、HypoEvalは双方向ペアワイズ判断とBradley-Terry-Davidson集約を組み合わせてランキングを行い、6次元のルーブリックスコアリングで診断します。15の最先端LLMでの実験により、明確な能力の階層化と、構造化分析スキルのモデル依存効果が明らかになりました。いくつかの低性能モデルではHypoArenaで向上が見られましたが、他のシステム(トップモデルを含む)では後退が見られました。絶対ルーブリックスコアリングと比較して、アリーナ評価はモデル間のより細かい差異を解像し、集約ランキングは人間の専門家および独立した評価者と強い一致を示しました。
これらの結果は、最終的な結論が隠されている場合にLLMがどのように調査方向を定式化するかを評価するための独立したターゲットとしてPHDを扱うことを支持しています。研究チームはコードとデータをgithub.com/SKYLENAGE-AI/HypoArenaで公開しています。