役立つAIモデルは、もっともらしい答えを返すだけでなく、指示を正確に守らなければなりません。これは単純に聞こえますが、実際はそうではありません。ユーザーは3文の要約、カジュアルなトーンでの書き直し、または特定の単語を含み別の単語を避ける回答を求めることがあり、しばしばそれらを同時に要求します。モデルはトピックを理解していても、間違える可能性があります。
NeurIPS 2025に採択された当社のIFBenchベンチマークは、言語モデルが正確な自然言語指示にどの程度従えるかをテストします。昨年、独立したAIベンチマーク組織であるArtificial Analysisは、IFBenchをその知能指数(複数の評価を統合してモデルの総合能力を測定するスコア)に追加しました。
「ユーザーの指示に従うモデルの能力は開発者にとって非常に重要であるため、明示的に評価したいと考えました」とArtificial Analysisの技術スタッフであるDeclan Jackson氏は述べています。「IFBenchはそのギャップを埋めるように設計され、最先端のモデルにとっても困難な課題でした。」
プロンプトへの遵守の測定
IFBenchは単に基本的な指示追従をテストするのではなく、モデルに単一の応答で複数のルールを守るよう強制します。単純なもの(最低単語数や必須キーワード)もあれば、よりトリッキーなもの(同じ長さの文、連続する単語の頭文字が同じでない、キーワードが正確な位置に来るなど)もあります。
「これは他の多くのベンチマークとは異なります。そこでは指示追従は出力テンプレートや要求された回答構造を通じて間接的にしか捉えられません」とJackson氏は言います。
各制約はそれだけ見れば恣意的に見えるかもしれませんが、それらが組み合わさることでよくある状況を反映しています。ユーザーはしばしばモデルに複数のことを同時に要求し、一つでも欠けると回答が台無しになります。IFBenchを実世界の使用に根ざすため、そのプロンプトは研究者がゼロから書いたものではなく、実際のユーザー会話から抽出されています。
「IFBenchは、以前の指示追従評価よりも実世界の使用に近い方法で指示追従を測定します」とJackson氏は言います。「プロンプトはカジュアルでユーザーらしい言葉を使い、固定テンプレートに従うのではなく幅広いトーンと長さをカバーし、事実に基づく質問応答、コンテンツレビューと要約、クリエイティブサポートなどの一般的なタスクに焦点を当てています。IFBenchの広いカバレッジは、指示追従能力のより強力な全体的シグナルにもなっています。」
IFBenchが他のベンチマークが見逃すものを示す
AIベンチマークは通常、寿命が短いです。モデルがトップスコアに近づくと、評価はシステムを区別するのに役立たなくなります。Artificial Analysisの知能指数に追加されたほとんどの評価は、約6ヶ月で飽和するとJackson氏は述べています。
しかしIFBenchは飽和していません。
「IFBenchのスコアは時間とともに改善されていますが、その進歩はモデル間で均一ではなく、新しい最先端モデルでも必ずしも良いパフォーマンスを示すわけではありません」とJackson氏は言います。
これにはいくつかの理由があります。
第一に、複雑な指示追従は、ほとんどのラボが積極的に訓練している能力と大きな重なりがないことです、とJackson氏は言います。コーディングやツールの使用は、その改善が他のタスクやベンチマークに一般化する傾向があるため、多くのポストトレーニング投資を受けています。指示追従はより狭く、これらの分野の進歩の副産物として改善されることはほとんどありません。
第二の理由は、IFBenchが測定する範囲の広さです。その幅広い制約とプロンプトのセットにより、進歩は、ラボが焦点を絞ったポストトレーニングレシピで徐々に取り組むことができる、よりターゲットを絞ったドメインや能力の評価に比べて遅くなっています。
これは数字に表れています。IFBenchのスコアはモデルファミリーごとに厳密にクラスター化し、ランキングはArtificial Analysisのより広範な知能指数と一致しないとJackson氏は言います。
xAIは依然としてIFBenchをリードしており、Grok 4.20(0309、推論)が82.9%でトップ、Grok 4.3が81.3%でそれに続きます。最近のGoogleモデルも良好なスコアを示しています:Gemini 3 Flash Preview(推論)が78.0%、Gemini 3.1 Flash-Lite PreviewとGemini 3.1 Pro Previewがそれぞれ77.2%と77.1%です。OpenAIのGPT-5.5(xhigh)とGPT-5.4(xhigh)は75.9%と73.9%で続きます。主要なClaudeモデルはIFBenchで低くクラスター化しており、Claude Opus 4.7、Claude Sonnet 4.6、Claude 4.5 Haikuは54.3%から58.6%の間です。しかしClaude Opus 4.7は知能指数で57ポイントとトップ近くにランクされ、GPT-5.5(xhigh)の60に次ぎ、Gemini 3.1 Pro PreviewやGPT-5.4(xhigh)(これも57)と実質的に同点です。
評価への真にオープンなアプローチ
IFBenchがArtificial Analysisにとって有用な理由は二つあります:それが測定するものと、私たちがそれをオープンに公開したという事実です。
オープン性により、Jackson氏のチームは評価を忠実に実装し、幅広いモデルで実行して、ユーザーが依存するリーダーボードを提供できます。また、誰でも何が測定され、なぜかを確認できるため、ベンチマーク自体の理解も容易になります。
Artificial Analysisにとって、IFBenchはほぼすべてのAIインタラクションで発生する問題をテストします:モデルがユーザーの要求、特に多くの要素を含む要求を追跡できるかどうか。これは現在Artificial Analysisの評価の定期的な一部となっており、Ai2のオープンベンチマークがこの分野にもたらす価値の強力な例です。
「評価を超えて、Ai2はオープンソースの重要なリーダーです」とJackson氏は言います。「彼らの研究は、オープンリサーチを通じて業界を前進させるだけでなく、データと方法論の透明性を備えた研究アーティファクトへのアクセスをユーザーに提供します。」
毎月のAi2ニュースを受け取るには購読してください。