[AINews] Claude Opus 5:Opus価格でFable級の性能(Fableの半額)
AnthropicはClaude Opus 5をリリースし、Opus価格(Fableの半額)でFableに迫る性能を実現しました。独立したベンチマークでは一部の指標でFableを上回っていますが、公式メッセージは慎重です。コミュニティの反応は、ベンチマークの不整合はあるものの、強力なコーディング能力とエージェンティックなツール使用を強調しています。
珍しい金曜日のリリースで、Opus 5が今日のヘッドラインを飾りました。公式ベンチマークのほとんどでは技術的にFableを上回っていますが、公式メッセージはまだ「近い」と述べています。これは主に、AnthropicがFableに残っているが測定できない「ビッグモデルの匂い」を反映していないEvalsの難しさ(今日のAIEトラックドロップ)を反映しています。
幸い、Opusの独立した評価は優れた性能を確認しています:@AnthropicAIはClaude Opus 5をリリースし、Artificial Analysis Intelligence Indexの新しいリーダーになりました。価格設定を超えた効率性の向上も重要ですが…GPT 5.6 Solにわずかに及ばないだけです。
AI Twitterまとめ
トップストーリー:Claude Opus 5モデルローンチ
何が起こったか
AnthropicのClaude Opus 5ローンチは、ベンチマーク精査、強い逸話的なコーディングエージェントの賞賛、そしてフロンティアモデル評価に関する新たな議論を引き起こしました。
複数のツイートがClaude Opus 5を新しくローンチされたモデルとして明示的に議論し、コーディングおよび一般的な能力指標で他のフロンティアシステムと比較しています(EpochのECI評価、FrontierCode異常の議論、ブラウザ自動化などのツール使用ワークフローからの初期ユーザー反応を含む)。
Epochは、Claude Opus 5がECI 159を達成し、「Fable 5の161をわずかに下回る」一方、ソフトウェアエンジニアリングベンチマークでSWE-ECI 161でFable 5と同等であると報告しました。
ECI結果はすぐに批判を招き、ユーザーはスコアがOpus 5の実用的な改善を過小評価していると感じました。ある返信は「信じられないほど過小評価されている」と述べ、実際には「ほとんどすべての点でずっと優れている」にもかかわらず、Opus 4.8よりわずか1ポイントしか良くないと指摘しました。同じユーザーはより難しい公開ベンチマークを求めました。
別のスレッドは明らかなベンチマーク異常を強調しました:FrontierCodeで、Opus 5は中程度の努力で高努力よりも良いスコアを出しましたが、他の評価ではより多くの努力が性能を向上させました。これは、タスク固有の検索/努力トレードオフまたは評価の不安定性を示唆しており、推論時間計算の増加による単調な利益ではありません。
数人の技術的にリテラシーの高いユーザーがOpus 5のコーディング性能を賞賛しました。Mikhail Parakhinは「Best-of-nルール」を述べ、Fableとの直接対決で「数学とすべての点で」明確な勝利を報告し、Codexで利用可能になることを望みました。
ArenaはOpus 5の第一印象を宣伝し、実際の使用に基づくリーダーボードスコアが近日公開されると述べ、コミュニティ評価が投稿時点でまだ追いついていないことを示しました。
Nous Researchのポータルはモデルへのアクセスを追加し、ユーザーはNous Portalを通じてOpus 5を直接使用でき、Opus 5を含むすべてのモデルに20%割引が適用されるとのツイートがありました。これは配布/可用性であり、能力の主張ではありません。
ユーザーの逸話はブラウザ制御/エージェンティックツール使用を強調しました。ある投稿はOpus 5がブラウザを開き、ChatGPT Proサブスクリプションをキャンセルしたと述べ、続いて「これは本当にブラウザを操作できる」と述べました。これらは孤立したデモであり、体系的な評価ではありませんが、コンピューター使用エージェントへの広範な市場の関心と一致しています。
他の初期の反応は技術的というよりミーム的で、「Opus 5地下鉄FPS結果」、「On Claude bro」、「彼らはAnthropicを恐れている」などがありました。これらは感情を反映していますが、証拠ではありません。
技術的詳細
Epoch Capabilities Index(ECI):
Claude Opus 5 ECI = 159
Fable 5 ECI = 161
Claude Opus 5 SWE-ECI = 161、ソフトウェアエンジニアリングでFable 5と同等
コミュニティの反応は、モデルがOpus 4.8よりわずか1ECIポイント高いだけであり、一部の読者は定性的な利益に対して小さすぎると考えました。
FrontierCodeの動作:ある評価者は、FrontierCodeでOpus 5の中程度の努力が高努力よりも優れていることを指摘しましたが、他の場所ではより多くの努力が通常改善をもたらします。ツイートはこの抜粋で生の数字を提供していませんが、中心的な技術的ポイントは、努力の増加が均一に有益ではなかったことです。
逸話的な比較主張:
あるユーザーのテストで、特にbest-of-nサンプリングでFableに対して明確な勝利
あるエコシステム要約投稿で「神話に匹敵」、ただし数字はなし
事実と意見
より事実的/測定指向の主張
Opus 5が159 ECIと161 SWE-ECIを達成したというEpochのベンチマーク声明は、セットの中で最も明確な経験的主張です。
第一印象が利用可能で実際のリーダーボードスコアが近日公開されるというArenaの声明は事実ですが不完全です。
Nous PortalがOpus 5へのアクセスを提供し20%割引を提供することは製品可用性の事実です。
解釈/意見
「ECIは過小評価されている」と「より難しい公開ベンチマークが必要」は、ベンチマークの有効性と感度に関する意見です。
「どんなベンチマークへの信頼を揺るがす方法:Anthropicがそれでまずい結果を示す」は、ベンチマークの言説とコミュニティバイアスに関する修辞的懐疑です。
「Best-of-nルール」とOpusがFableに対して「非常に明確な勝者」であることは、非公式の実務家判断であり、有用ですが非標準化されています。
「彼らはAnthropicを恐れている」とAnthropicに関連するAGIタイムラインの憶測は、純粋な意見/推測であり、ローンチの証拠ではありません。
異なる意見
支持的な見解
最も強い肯定的な解釈は、Opus 5が現在の公開集計ベンチマークが示すよりも実際の使用で実質的に強力であり、特にコーディングとツール使用タスクで顕著であることです。
@MParakhinは自身のテストでFableを打ち負かし、best-of-nが結果を改善すると報告。
@abacajは効果的なブラウザ自動化を強調し、実用的なエージェント能力を示唆。
@bijanbowenは「地下鉄FPS結果」をこれまでで最高と呼び、ビジュアル/コンピューター使用デモの品質が視聴者に印象を与えたことを示唆。
@eliebakouchはOpus 5をトップクローズドモデルリリースの一つに位置付け、「神話に匹敵」と述べ、トップティアのフロンティアエントラントとして位置づけ。
懐疑的/批判的な見解
主な批判はOpus 5が弱いということではなく、それを取り巻くベンチマークが不安定で、不十分に指定され、ユーザーの印象とずれていることです。
@jerhadfはFrontierCodeでの困惑させる努力スケーリングの不一致を指摘。
@scaling01はECI結果が観察された改善に対して低すぎると主張し、より難しい公開ベンチマークを求める。
@teortaxesTexは一部のベンチマーク信頼は条件付きであり、Anthropic固有の結果がベンチマーク批判を引き起こす、つまり社会的解釈が技術的評価を汚染している可能性があると示唆。
中立的/分析的な見解
Epochのフレーミングは控えめ:全体ではFableをわずかに下回り、SWE固有の能力で同等。
Arenaの「今第一印象、後で実際のリーダーボード」も中立的な姿勢であり、コミュニティがまだ堅牢なランキングに収束していないことを効果的に示しています。
背景
Claudeファミリーモデルはすでに強力なコーディング性能、長いコンテキストの実用性、比較的洗練されたエンタープライズ/製品パッケージングで知られていたため、Opus 5はユーザーがAnthropicがコーディングのリードを維持または拡張できるかどうかをテストする準備ができている市場に参入しました。
このローンチは、静的なチャットベンチマークからエージェンティック評価(ブラウザ使用、ツール呼び出し、並列タスク実行、ソフトウェアエンジニアリングループ完了)へのより広範なシフトの中で行われています。そのため、ブラウザキャンセルワークフローのようなカジュアルな逸話でさえ注目を集めました。それらは、古典的なQAベンチマークが見逃す現実世界の能力のカテゴリに対応しているからです。
Opus 5をめぐるベンチマークの摩擦は、より広範なエコシステムの問題に適合します:集計能力スコアは多様な行動を単一の数値に圧縮することがよくあります。ECIと類似の指標は広範な追跡に有用ですが、単一数値の要約は以下を隠す可能性があります:
コーディング対非コーディングの専門化
推論時間計算/努力スケーリング行動
best-of-nの利得
ツール使用の信頼性
現実世界の遅延/コストトレードオフ
FrontierCodeの「中程度の努力が高努力を打ち負かす」観察は、フロンティアラボがますますテスト時間計算と検索に依存しているため、特に関連性が高いです。より多くの努力が特定の分布で害になる場合、デプロイメントポリシーはベースモデルの品質とほぼ同じくらい重要になります。
ECIの議論はまた、Opus 5がソフトウェアエンジニアリングの強みが全体的な万能能力の向上よりも顕著なケースである可能性を示唆しています。Epochの数字はこの区別を直接支持しています:全体159対SWE-ECI 161。
周囲のツイートにおける競争の背景には、Fable 5、GPT 5.6、Grok 4.5、Kimi K3、Mythos、およびオープンウェイトの勢いへの繰り返しの言及が含まれています。したがって、Opus 5は孤立して判断されるのではなく、以下のような混雑したフロンティア分野で判断されています:
コーディング能力は重要な楔
コスト/効率が重要
公開ベンチマークは製品化されたエージェント使用に遅れを取っている
ツイートセットにおける最も強い親Anthropic感情の一部は、ベンチマークではなく評判に部分的に基づいています——例えば、他者が「Anthropicを恐れている」という主張。専門家の読者にとって、より実質的なシグナルは、ベンチマーク懐疑論者でさえもOpus 5がどれだけ優れているかについて議論しており、それがフロンティアに属するかどうかではないことです。
モデルのリリースはまた、AI安全性と自律性インシデントをめぐるより広範な言説と交差しました。これには、別のエージェント設定からのロイター報道や、秘密の調整と「企み」に関するコメントが含まれます。Opus 5に直接関係するものではありませんが、この言説はおそらくユーザーがAnthropicのローンチを解釈する方法を形成しました。Anthropicは安全意識の高いブランドと強く関連付けられているからです。
実際的な含意は、Opus 5の受け入れが2つの同時のレンズを通してフィルタリングされていることです:
ユーザーがすぐに操作できるコーディング/エージェント製品として
ますます敵対的なベンチマークと安全性の精査に直面するフロンティアモデルとして
その組み合わせがこれらのツイートのローンチパターンを説明しています:古いモデルローンチよりも「スペックシート」投稿が少なく、評価方法論、エージェントデモ、実際のコーディング性能に関する議論が多い。
その他のトピック
オープンモデル、蒸留、AI主権
NVIDIAのJensen Huangは、AIは「すべての業界を変革し、すべての企業を強化し、すべての国によって構築される」ため、オープンモデルは安全性、サイバーセキュリティ、イノベーション拡散、主権に有益であると主張する手紙を投稿しました。
この手紙はエコシステムの人物や企業からの支持を集め、@MarkMcQuade、@ClementDelangue、@vincentweisser、@willccbbからの反応があり、あるコメンテーターはJensenが明示的に蒸留に言及したことに満足しました。
いくつかの投稿は、オープンウェイトが政治的に追い出されていないというポジティブなシグナルとしてこの日を捉えました。
一部の人は「オープンウェイト」よりも強い基準を求め、コードとデータの開放性も要求しました。
Hugging FaceのQuentin Gallouédecは、オープンウェイトのレトリックだけでなく、オープンソースAIインフラへのHFの投資を強調するためにGitHubアクティビティのコンテキストを投稿しました。
安全性インシデント、脅威フレーミング、サイバーポリシー
ロイター報道
[AIコスト制御のため省略]