現在、オープンモデルはクローズドモデルに永久に追いつけない均衡状態にあるように見えるが、このギャップを単一の数値(例:Artificial Analysis Intelligence Index)で捉えることは、モデルがカバーする能力の微妙で重要な動態を覆い隠している。この指数は約10のサブ評価からなる複合ベンチマークで、言語モデルの「フロンティア」を捉えるために維持されている。私は、この指数に影響を与える動態が、パフォーマンスやトレンドを一つの数字に還元する傾向によって誤解されている様子を多く研究してきた。
ベンチマーク自体も時間とともに進化し、実際の使用との相関が強まったり弱まったりする。異なるモデルの実世界性能とベンチマークランキングの関係は単純ではない。さらに、訓練手法の変化もベンチマークに影響を与える。例えば、Gemini 3は驚くべきベンチマークスコアを示したが、現在AIツールがテスト・展開されている主要分野(エージェント)ではほとんど無視されており、測定方法の根本的な欠陥を露呈している。
この動態の根底には業界の絶え間ない変化がある。およそ12〜18ヶ月ごとにベンチマークの焦点が移る。各関心領域は、特にポストトレーニングにおいて、非常に異なる訓練ドメインと関連している。一つのパラダイムが長く続くほど、業界は性能測定に長けるようになる。しかし、急速なポストトレーニング改善の新時代において、私のベンチマークへの信頼は相対的に最低点にある。
ChatGPT直後は、チャット、数学、簡単なコードが焦点だった。指示チューニングとRLHFが支配的だったが、チャット能力はすぐに飽和し、数学は焦点でなくなった。2025年から現在にかけて、推論モデルがデフォルトとなり、焦点はより複雑なコーディングや単純なエージェントタスクに移った。現在の訓練レシピは検証可能な報酬を用いた強化学習(RLVR)が主流だが、その応用領域は基本的な質問応答チェックから複雑な環境へと大きく変化している。
フロンティアラボは、コードや端末タスクといった現在の焦点を習得するために巨額の投資を行い、同時に会計、法律、医療などの専門知識を要する多様な知識仕事にも進出している。これらの新しいタスクは依然としてエージェント的だが、より専門性と既存ソフトウェアやドメイン固有ツールとの統合が必要となる。
複雑な言語モデルワークフローの評価自体が困難な研究課題である。タスクは難しくなり、必要なデータは(GitHub上の大量のコードと比較して)よりプライベートになっている。大手オープンモデルラボは、データ業界における経済的動向(米国の数少ないフロンティアラボが新しい環境やデータセットに巨額を支払い、中国などのフォロワーラボが後で大幅割引で購入する)の恩恵を受けている。この重要な点は見逃されがちだ。非フロンティアラボが追いつくための手段は常に変化している。中国のモデルの進歩を蒸留にのみ焦点を当てることは、現在の訓練パラダイムにおけるRL環境の重要性を見落としている。Artificial Analysis Index内の単一評価またはそれを模倣した環境を構築できれば、中国のラボは追いつき続けるだろう。
現在のタスクセット(コーディングと端末タスク)が、OpenAIやAnthropicがビジネス採用で優位に立つ上でどれほど重要かは、収益維持に直結する問題だ。もしエージェント的コーディング能力が飽和し、AIパフォーマンスの「フロンティア」が別の場所に移れば、企業収益の多くは、モデル性能の圧倒的な差ではなく、顧客関係、慣性、製品開発の巧拙に依存するようになるかもしれない。
この不安定な立場は、フロンティアラボが常に自己変革を迫られていることを示している。私は依然として、大規模AIインフラへの投資は報われると信じており、AnthropicとOpenAIは莫大な利益を上げるだろうと考えている。そのためには、彼らが価値ある新ユースケースを開拓し続け、オープンモデルが接近しているベンチマークが完全なシグナルではないことを前提としている。
私は、中国の主要オープンモデルは米国のフロンティアラボよりもベンチマークに重点を置いていると推測している。彼らは最良のクローズドモデルに常に迫っているイメージを示すインセンティブを持つ。しかし、中国のラボがベンチマークへの過適合だけでこの物語を維持していると言うのは極めて単純で誤りだ。彼らのモデルは確かに強力であり、過剰宣伝と真の革新のバランスは微妙である。WeirdMLやARC AGI 2などの分布外ベンチマークではオープンモデルは大きく遅れを取るが、無数のランダムベンチマークでは予想以上に強い。実際に使うと、ロバストネスの欠如(長文脈での性能低下、Claude/Codexよりも頻繁なエージェントコンテキストのリセット必要性)を感じるが、根本的に異なるクラスのモデルではない。多くの人が予想したよりもずっと近い。
オープンモデルはいつまで追いつき続けられるのか?それはまだ未解決の問いである。