Collider-Bench: 素粒子物理解析の再現によるAIエージェントのベンチマーキング
Collider-Benchは、大規模言語モデル(LLM)エージェントが公開論文とオープンソースソフトウェアのみを用いて大型ハドロン衝突型加速器(LHC)の実験解析を再現できるかを評価する新しいベンチマークです。エージェントはシミュレーション・選択パイプラインを構築し、指定されたシグナル領域での衝突事象の収量を予測します。評価にはヒストグラム指標とLLM判定器が用いられ、失敗モードを検出します。初期結果では、いずれのエージェントも人間の物理学者による解法を確実に上回ることはできませんでした。
最近、arXivに投稿された論文で提案されたCollider-Benchは、大規模言語モデル(LLM)エージェントが公開論文とオープン科学ソフトウェアのみを使用して、大型ハドロン衝突型加速器(LHC)の実験解析を再現できるかどうかを評価するための新しいベンチマークです。この研究はDarius A. Faroughyら5名の著者によって行われ、既存のベンチマークでは捉えきれない実際の科学作業の複雑さと微妙さを評価することを目的としています。
素粒子物理学の分野では、実験コラボレーション内部で使用されるソフトウェアと公開ツールチェーンには差異があり、公開された論文には忠実な再構築に必要な実装詳細が欠落しているため、解析の再現は困難です。Collider-Benchでは、エージェントは公開された解析を実行可能なシミュレーション・選択パイプラインに変換し、指定されたシグナル領域での衝突事象の収量を予測する必要があります。予測は標準的なヒストグラム指標で評価され、手動のルーブリックなしで連続的な忠実度スコアが得られます。さらに、研究者は各エージェントがタスクごとに要する計算コストも報告し、LLM判定器を使用してコードベースとセッション全体のトレースを評価し、捏造、幻覚、重複などの定性的な失敗モードを捕捉します。
このベンチマークには、LHCの探索から抽出された初期タスクセットと、コンテナ化されたサンドボックス、事象シミュレーションツールが含まれており、誰でも評価を再現できます。研究者は汎用コーディングエージェントの能力ラダーにわたって評価を行い、結果は平均的にはどのエージェントも「物理学者がループに関与する解法」を確実に超えることはできないことを示しました。一部のエージェントは特定のサブタスクで優れるものの、物理定数の誤用や検出器の幾何形状に関する幻覚などが頻発し、ドメイン知識とツール利用の統合が課題であることが浮き彫りになりました。この研究は、科学研究におけるAIの評価に新たな基準を設け、より頑健な科学エージェントの開発への道筋を示しています。