AI News HubLIVE
サイト内リライト2 分で読了

大規模言語モデルの相対的好み評価のためのコンセンサスベースのフレームワーク

本論文は、複数の大規模言語モデル(LLM)が互いの匿名出力を投票でランク付けし、相対的知能指数(RII)を計算することで、絶対的な正しさではなくモデル間の相対的好みを測定するコンセンサスベースの評価フレームワークを提案する。研究では、5つの最先端LLMをプログラミング、常識、安全性、論理推論、数学などの分野でテストし、一貫した好みのパターンが見られた。ただし、この結果はモデル間の一貫性を反映しており、客観的な正しさや人間の判断ではないことに留意すべきである。この手法は、複数の有効な答えが存在するシナリオにおいて、スケーラブルでモデル駆動型の比較評価を提供する。

ソースarXiv Computational Linguistics著者: Mohtashim Khan

大規模言語モデル(LLM)の評価は依然として重要な課題です。従来のベンチマークは静的データセットと客観的なスコアリング指標に依存しており、複数の正解が存在する場合に応答の明瞭さ、完全性、有用性の違いを区別できないことがよくあります。この問題に対処するため、Mohtashim Khan氏による論文「A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models」では、コンセンサスベースの新しい評価フレームワークを提案しています。

このフレームワークの核心は、絶対的な正しさではなく、LLM間の相対的な好みを測定することです。具体的には、多様なLLMからなる「審査委員」が、同じプロンプトに対する匿名化された応答を独立してランク付けします。これらのランキングを集約して、各モデルの応答が他のモデルにどれだけ好まれるかを示す「相対的知能指数(Relative Intelligence Index, RII)」を計算します。この方法は、モデル間の一致認識を応答品質の代理指標として扱います。

実験では、5つの最先端LLMがプログラミング、一般知識、安全性、論理推論、数学などの複数ドメインでテストされました。各モデルはまず応答を生成し、次に構造化された投票プロセスを通じて他のモデルの匿名応答を独立して評価しました。結果はドメイン横断的な一貫した好みのパターンを示し、特定のモデルが他のモデルから高く評価される傾向があることがわかりました。ただし、論文ではこれらの結果がモデル間の選好一致を反映しており、客観的な正しさや人間の判断ではないことが強調されています。先行研究では、集約されたモデルの好みが人間の評価と部分的に相関する可能性が示唆されており、このフレームワークは近似信号として有用です。

このフレームワークは、複数の有効な答えが存在するシナリオにおいて、スケーラブルでモデル駆動型の比較評価を提供します。人間の評価と完全に一致するわけではありませんが、その自動化された効率性からモデル開発や比較において潜在的な価値を持ちます。論文はarXiv(ID: 2607.21632)で公開されており、14ページ、7つの図表を含んでいます。詳細な実験設定と結果は論文を参照してください。

大規模言語モデルの相対的好み評価のためのコンセンサスベースのフレームワーク | AI News Hub