本文にスキップ
AI News HubLIVE
サイト内リライト3 分で読了

【AINews】GPT-6 Astra:OpenAI史上最大規模のLLMリリース

記事の要約

OpenAIが新フラッグシップモデル「GPT-6 Astra」を発表。「最も知的で整合したモデル」とされ、コンピュータ操作やソフトウェアエンジニアリング、数学・科学分野での飛躍がうたわれた。一方、第三者評価では能力向上は一様ではなく、トークン価格の上昇と思考連鎖の監視可能性の低下が、ベンチマーク飽和や安全性、ガバナンスをめぐる激しい議論を呼んでいる。

ソースLatent Space
【AINews】GPT-6 Astra:OpenAI史上最大規模のLLMリリース
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

公開からまだ9時間足らずで、GPT-6 Astraは3600万回のビューと16万4000件のいいねを記録し、OpenAIにとってSoraやGPT-4、GPT-5時代以来の成功を収めた。これまでAnthropicにローンチ人気で後れを取ることが多かったOpenAIが、初めてその流れを覆した形だ。AstraはAnthropicのFableやOpusへの対抗策として広く受け止められている。

OpenAIはAstraを「これまでで最も知的で整合したモデル」と位置づけ、コンピュータ使用、ソフトウェアエンジニアリング、数学・科学、文書作成、サイバーセキュリティでの進歩を強調した。展開はまず一部の組織向けに始まり、その後数日かけてChatGPT Plus/Pro/Business/Enterprise、API、AWSへ拡大する。価格は標準が入力100万トークンあたり10ドル、出力50ドル、高速版は入力20ドル、出力100ドルで、最大2.5倍の速度を謳う。Codexの質問機能や長いタスク中のコンテキスト保持・検索機能、Responses APIの非同期関数呼び出しなども同時発表された。

ただし、ローンチはスムーズとは言えなかった。遅延、ブログ記事の公開障害、アクセス時期の不透明さ、先にアクセスを得たインフルエンサーと有料ユーザーとの格差への不満が噴出。OpenAIは有料ユーザーに対し、Astraにアクセスできなかった日数を補償する「バンクドリセット」を提供した。また、公開されたシステムカードは、整合性の向上と引き換えに思考連鎖の監視可能性が下がったと述べ、特に注目を集めた。

OpenAIの公式発表では、ARC-AGI-3で99.9%、FrontierMath Tier 4で98%、ExploitBenchで100%というスコアや、Mind2WebでGPT-5.6 Solより1.9倍速いという主張があった。さらにAstraが「数学の長年の未解決問題の解決に貢献した」とも報じられた。しかし、独立系の評価はより複雑だ。Artificial Analysisによると、Coding Agent IndexでAstraは67点を獲得し、Claude Opus 5やFable 5とほぼ同等、Fable 5.1の70点には及ばない。トークン効率はGPT-5.6 Solより70%高く、Codexハーネスでは5分の1のトークンで済む一方、トークン単価の上昇により最大努力時はタスクあたり約75%割高になる。Intelligence IndexではGPT-5.6 Solと同等で、Claude Fable 5.1やMetaのMuse Spark 1.3より低い。独自の幻覚率は92%から51%に下がったが、一部の非選択的なベンチマークでは約80 Eloの後退も確認された。

ARC PrizeとARC-AGIの関係者は、Astraを画期的と評価しつつ、ハーネス依存性を強調した。ARC-AGI-3では、標準ハーネスで63〜66%だったのが、プロバイダーアダプター型ハーネスや継続的会話+カスタム圧縮では99%近くに達する。Astraは96%のレベルで人間の中央値より少ないアクション数で完了し、永続的な世界モデルや座標抽象化、長大な計画能力を示したという。ARC-AGI-3は6カ月で1%未満からほぼ満点に達しており、François Chollet氏はARC-AGI-4を2027年第1四半期に出すと明言した。

コミュニティの反応は、コンピュータ利用や3D生成、長大な知識作業、形式推論を賞賛する声と、監視可能性の低下、評価への過適合、ベンチマーク飽和、リリースガバナンスを批判する声に分かれた。後者の論点は、目に見える整合性の向上が根本的な目標誤整合を解決せず、特定の失敗モードを覆い隠しているだけではないかという懸念だ。OpenAIは防御側や重要インフラへの支援として、Daybreak関連で10億ドルのアクセス/補助金コミットメントも発表している。

今回の発表は、ベンチマークが文化の変化よりも速く飽和していること、フロンティアの競争がチャットやコードから、コンピュータ操作、空間推論、長大なエージェント計画、定理証明、サイバーセキュリティへと広がっていることを改めて示した。安全評価も、単なる拒否率や整合率ではなく、隠れた推論状態での監視可能性と制御可能性へ焦点が移っている。コストも単なるトークン価格ではなく、タスクあたりコストや目標スコアまでの価格で見られるべきだという議論が強まっている。そして「AGI」の意味をめぐる分裂はさらに深まり、達成を示す証拠か、経済変革には不十分か、あるいは本当に問うべきは制御可能性なのかという三つの立場が対立している。

要点と分析を開く

記事インテリジェンス

エンジニア中級

要点

  • GPT-6 Astraは公開から9時間足らずで3600万回再生を記録し、OpenAI近年で最も成功したローンチとなった。
  • OpenAIはARC-AGI-3、FrontierMath Tier 4、ExploitBenchでの最高水準を主張するが、独立系評価では計測環境による差異や能力のばらつきが指摘されている。
  • 標準価格は入力100万トークンあたり10ドル、出力50ドルで、前モデルより高いが、トークン効率の改善によりタスクによっては割安になる。
  • 思考連鎖の監視可能性が低下したとのシステムカード公表が、安全性・監視・リリースガバナンスをめぐる論争の中心となっている。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。