本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

今日のオープン・クローズド パフォーマンスギャップを読み解く

記事の要約

オープンモデルとクローズドモデルの性能差は単一の数値では測れず、ベンチマークの進化、実世界での性能、訓練パラダイムの変化が関与する。ベンチマークの信頼性は低下し、フロンティアラボは収益維持のために常に革新を迫られている。中国のオープンモデルはベンチマークで優れるが、ロバストネスや実用面では課題がある。

ソースInterconnects (Nathan Lambert)著者: Nathan Lambert
今日のオープン・クローズド パフォーマンスギャップを読み解く
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

現在、オープンモデルはクローズドモデルに永久に追いつけない均衡状態にあるように見えるが、このギャップを単一の数値(例:Artificial Analysis Intelligence Index)で捉えることは、モデルがカバーする能力の微妙で重要な動態を覆い隠している。この指数は約10のサブ評価からなる複合ベンチマークで、言語モデルの「フロンティア」を捉えるために維持されている。私は、この指数に影響を与える動態が、パフォーマンスやトレンドを一つの数字に還元する傾向によって誤解されている様子を多く研究してきた。

ベンチマーク自体も時間とともに進化し、実際の使用との相関が強まったり弱まったりする。異なるモデルの実世界性能とベンチマークランキングの関係は単純ではない。さらに、訓練手法の変化もベンチマークに影響を与える。例えば、Gemini 3は驚くべきベンチマークスコアを示したが、現在AIツールがテスト・展開されている主要分野(エージェント)ではほとんど無視されており、測定方法の根本的な欠陥を露呈している。

この動態の根底には業界の絶え間ない変化がある。およそ12〜18ヶ月ごとにベンチマークの焦点が移る。各関心領域は、特にポストトレーニングにおいて、非常に異なる訓練ドメインと関連している。一つのパラダイムが長く続くほど、業界は性能測定に長けるようになる。しかし、急速なポストトレーニング改善の新時代において、私のベンチマークへの信頼は相対的に最低点にある。

ChatGPT直後は、チャット、数学、簡単なコードが焦点だった。指示チューニングとRLHFが支配的だったが、チャット能力はすぐに飽和し、数学は焦点でなくなった。2025年から現在にかけて、推論モデルがデフォルトとなり、焦点はより複雑なコーディングや単純なエージェントタスクに移った。現在の訓練レシピは検証可能な報酬を用いた強化学習(RLVR)が主流だが、その応用領域は基本的な質問応答チェックから複雑な環境へと大きく変化している。

フロンティアラボは、コードや端末タスクといった現在の焦点を習得するために巨額の投資を行い、同時に会計、法律、医療などの専門知識を要する多様な知識仕事にも進出している。これらの新しいタスクは依然としてエージェント的だが、より専門性と既存ソフトウェアやドメイン固有ツールとの統合が必要となる。

複雑な言語モデルワークフローの評価自体が困難な研究課題である。タスクは難しくなり、必要なデータは(GitHub上の大量のコードと比較して)よりプライベートになっている。大手オープンモデルラボは、データ業界における経済的動向(米国の数少ないフロンティアラボが新しい環境やデータセットに巨額を支払い、中国などのフォロワーラボが後で大幅割引で購入する)の恩恵を受けている。この重要な点は見逃されがちだ。非フロンティアラボが追いつくための手段は常に変化している。中国のモデルの進歩を蒸留にのみ焦点を当てることは、現在の訓練パラダイムにおけるRL環境の重要性を見落としている。Artificial Analysis Index内の単一評価またはそれを模倣した環境を構築できれば、中国のラボは追いつき続けるだろう。

現在のタスクセット(コーディングと端末タスク)が、OpenAIやAnthropicがビジネス採用で優位に立つ上でどれほど重要かは、収益維持に直結する問題だ。もしエージェント的コーディング能力が飽和し、AIパフォーマンスの「フロンティア」が別の場所に移れば、企業収益の多くは、モデル性能の圧倒的な差ではなく、顧客関係、慣性、製品開発の巧拙に依存するようになるかもしれない。

この不安定な立場は、フロンティアラボが常に自己変革を迫られていることを示している。私は依然として、大規模AIインフラへの投資は報われると信じており、AnthropicとOpenAIは莫大な利益を上げるだろうと考えている。そのためには、彼らが価値ある新ユースケースを開拓し続け、オープンモデルが接近しているベンチマークが完全なシグナルではないことを前提としている。

私は、中国の主要オープンモデルは米国のフロンティアラボよりもベンチマークに重点を置いていると推測している。彼らは最良のクローズドモデルに常に迫っているイメージを示すインセンティブを持つ。しかし、中国のラボがベンチマークへの過適合だけでこの物語を維持していると言うのは極めて単純で誤りだ。彼らのモデルは確かに強力であり、過剰宣伝と真の革新のバランスは微妙である。WeirdMLやARC AGI 2などの分布外ベンチマークではオープンモデルは大きく遅れを取るが、無数のランダムベンチマークでは予想以上に強い。実際に使うと、ロバストネスの欠如(長文脈での性能低下、Claude/Codexよりも頻繁なエージェントコンテキストのリセット必要性)を感じるが、根本的に異なるクラスのモデルではない。多くの人が予想したよりもずっと近い。

オープンモデルはいつまで追いつき続けられるのか?それはまだ未解決の問いである。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • オープンとクローズドのギャップは多面的で、単一の指標では捉えられない。
  • ベンチマークは進化し、実世界の性能との相関が低下している。
  • 中国のオープンモデルはベンチマークに強いが、ロバストネスやエージェントタスクで遅れを取る。
  • フロンティアラボは競争優位と収益維持のために常に新領域を開拓する必要がある。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。