AI News HubLIVE
サイト内リライト2 分で読了

Claude Opus 5 の発表

Anthropic が Claude Opus 5 をリリース。Claude Fable 5 のフロンティアインテリジェンスに半額で迫る、思慮深くプロアクティブなモデルです。コーディングや知識作業の評価で新たな最先端を達成し、ソフトウェアエンジニアリング、科学研究、視覚出力に優れます。ユーザーはその判断力、自己検証能力、反復処理の徹底さを高く評価しています。サイバーセキュリティでは Mythos 5 に劣るものの、アライメントと安全性は最高水準です。

Anthropic は2026年7月24日、Claude Opus 5 を正式に発表しました。この新モデルは「思慮深くプロアクティブ」と評され、インテリジェンスレベルではフラッグシップモデル Claude Fable 5 に迫りながら、価格はその半分です。Opus 5 は日常使いを想定して設計されており、Claude Max のデフォルトモデルとなり、Claude Pro 上で最も強力なモデルです。

性能とコスト効率の面では、前世代 Opus 4.8 と同コストで大幅な性能向上を実現しています。ユーザーはモデルの「努力レベル」設定を調整することで、インテリジェンスを最適化したり、トークンを節約してより高速かつ低コストで結果を得ることができます。ソフトウェアエンジニアリングタスクでは特に優れており、Frontier-Bench v0.1 では全モデルを凌駕し、タスクあたりのコストは低く、Opus 4.8 の2倍以上の性能を発揮。CursorBench 3.2 では最大努力時、Fable 5 のピークスコアに0.5%差で迫りながらコストは半分です。知識作業・問題解決タスクでも同様に、ARC-AGI 3 では次点モデルの3倍のスコア、Zapier AutomationBench では通過率が次点の約1.5倍、OSWorld 2.0 では Fable 5 のベスト結果を3分の1強のコストで上回ります。

科学研究において Opus 5 は Opus 4.8 から有意な改善を示し、生命科学評価の全項目で優れています。分光データからの分子構造推論では Opus 4.8 より10.2ポイント向上、タンパク質配列変異の機能予測では7.7ポイント向上しました。また、ビジュアル出力能力も大幅に強化され、空気力学の流れの可視化や細胞のインタラクティブイラストなどを生成できます。

Opus 5 の強みは自己検証と反復処理能力です。Frontier-Bench のタスクでは、図面を直接参照できない状況で、自らコンピュータビジョンパイプラインを構築してピクセルから形状を抽出、3Dモデルを再構築しました。人気のオープンソースパッケージマネージャのバグ修正では、コミュニティが見逃したエッジケースまで修正。早期アクセスユーザーからも高い評価を得ており、Devin は FrontierCode で半額で Fable に迫る性能、Cursor は CursorBench で Fable 5 に近い挙動を確認。Zapier の AutomationBench では100%通過、ゲノム解析では慎重な科学者のような振る舞いを示しました。Lovable は Opus シリーズ最大の飛躍と評価し、フロントエンドのアニメーションや3D作品で過去最高と述べています。

アライメントと安全性において、Claude Opus 5 は自動行動監査で過去最高のアライメントスコアを達成。Opus 4.8、Sonnet 5、Fable 5 よりも憲法への遵守度が高く、欺瞞的行動の発生率が最も低く、悪用への誘導耐性も最大です。安全面では、リスクの高いデュアルユース能力のフロンティアを拡大しておらず、生物学研究と攻撃的サイバーセキュリティで Mythos 5 に劣ります。Anthropic は Opus 5 をサイバーセキュリティタスクで意図的に訓練していないため、脆弱性発見では Mythos 5 に迫るものの、その悪用能力では大幅に劣ります。詳細はシステムカードに記載されています。