AI News HubLIVE
サイト内リライト2 分で読了

Relay-Bench: マルチドメイン推論チェーンにおけるLLMの評価

Relay-Benchは、1つのプロンプトで複数の異なるドメインのタスクを完了するLLMの能力を測定する新しい未飽和のベンチマークです。最良モデルGPT-5.5(xHigh)のスコアはわずか43.3%で、多ドメイン複合推論における改善の余地が示されています。

ソースarXiv Computational Linguistics著者: Liam Swayne

新しいベンチマーク「Relay-Bench」が公開されました。これは、大規模言語モデル(LLM)が複数の異なるドメインにわたる推論チェーンをどれだけ効果的に処理できるかを評価するために設計されています。従来の単一ドメインベンチマークとは異なり、Relay-Benchは1つのプロンプト内で複数のサブ問題を連続して解く必要があり、現実世界で要求される総合的なスキルを反映しています。

テストセットは完全に複合問題で構成されており、各問題は2から13の単一ドメインサブ問題から成ります。対象ドメインは、視覚推論(テキストベース)、コーディング、数学、情報抽出(特にウェブ検索)、問題解決、一般知識、データ分析の8つです。さらに、問題にはプロンプトエンコーディングや意図的なコンテキストの肥大化(context bloat)による複雑さの層が追加されており、モデルはノイズの中から重要な情報を抽出する必要があります。

最新の評価では、OpenAIのGPT-5.5(xHigh)が最も高いスコア43.3%を記録しましたが、これはまだ飽和状態には程遠い数値です。注目すべきは、モデルに外部制限が一切課されず、コード実行やウェブ検索などのツール使用が明示的に奨励されている点です。完全な自律性が与えられたにもかかわらず、この結果は、現在のLLMが複数ドメインの知識を統合し、長い推論チェーンを実行する際に根本的な課題を抱えていることを示しています。

Relay-Benchの登場により、AI研究コミュニティはより実践的な評価ツールを手に入れました。従来のベンチマークは単一スキルに焦点を当てがちでしたが、現実の問題は複数ドメインにまたがるものです。このベンチマークはそのような複合性を捉えることを目的としており、モデルの汎化能力を促進すると期待されています。研究者らは、Relay-Benchが将来のLLM性能の重要な指標となり、組み合わせ推論、ツール使用、コンテキスト管理におけるブレークスルーを促進する可能性があると述べています。関連論文はarXiv(番号:2607.18438)に提出され、今後の会議で発表される予定です。論文は21ページ、7つの図表を含み、ベンチマークの構築方法、難易度の制御、サンプル分析について詳述しています。