AI News HubLIVE
サイト内リライト4 分で読了

新しいClaude Opus 5のご紹介:同じOpus価格で最前線のエージェントコーディングとコンピューター利用

AnthropicはClaude Opus 5をリリースし、Opus 4.8に代わるOpus層のフラッグシップとしました。価格は据え置き(入力100万トークンあたり5ドル、出力25ドル)で、Claude Fable 5の半分の価格でその知能に迫ります。主な変更点として、思考機能がデフォルトでオン、無効化時の破壊的変更、検証プロンプトの削除などがあります。エージェントコーディングとコンピューター利用のベンチマークで卓越した性能を示し、特にOSWorldとZapier AutomationBenchで優れています。セキュリティ面では、ソースコードの脆弱性発見のみが緩和され、悪用経路は引き続きブロックされています。

ソースMarkTechPost著者: Asif Razzaq

Anthropicは本日、Claude Opus 5をリリースしました。これはOpus 4.8に代わるOpus層のフラッグシップモデルです。価格は据え置きで、入力100万トークンあたり5ドル、出力100万トークンあたり25ドルです。Anthropicチームによると、Opus 5の知能はClaude Fable 5に迫りながら、価格はその半分です。現在、Claude Maxのデフォルトモデルとなり、Claude Pro上で最も強力なモデルです。

APIレベルでは、3つの重要な変更があります。まず、思考機能がデフォルトでオンになりました。Opus 4.8ではthinking: {"type": "adaptive"}を設定しない限り思考は行われませんでしたが、Opus 5では自動的に思考が行われ、effortパラメーターで深さを制御します。max_tokensは思考と応答テキストを合わせた上限となるため、既存の設定を見直す必要があります。次に、破壊的変更として、thinking: {"type": "disabled"}をxhighまたはmaxの努力レベルと共に設定すると400エラーが返ります。この制限はリクエストごとに適用され、努力をhighに制限するか、thinkingフィールドを削除する必要があります。最後に、Anthropicは開発者に検証プロンプトを削除するよう推奨しています。「最終検証ステップを含める」といった指示は過剰検証を引き起こす可能性があり、モデルは既に自己検証を行うためです。Opus 5のプロンプトガイドで調整パターンが説明されています。

モデルIDはclaude-opus-5で、コンテキストはデフォルトおよび最大の両方で100万トークン、小規模バージョンはありません。同期Messages APIの最大出力は128kトークン、Messages Batches APIではoutput-300k-2026-03-24ベータヘッダーを使用して300kトークンに達します。最小キャッシュ可能プロンプトは512トークンに低下し、以前の1024トークンから減少しました。

コーディングとエージェント能力の結果は顕著です。FrontierBench v0.1(Terminal-Bench 2.1の後継で74タスク)で、Opus 5は最大努力で43.3%を記録し、Opus 4.8の18.7%を大きく上回りました。Fable 5は33.7%、GPT-5.6 Solは37.5%でした。xhigh努力では44.4%の平均報酬に達し、最高結果を示しました。この実行から注目すべき点として、Opus 5の安全分類器はAPIコールの5%をフラグ付けして拒否し、試験の4%に影響しました。Fable 5の分類器はコールの42%、試験の26%をフラグ付けしました。

SWE-bench Verifiedでは96.0%、SWE-bench Proでは79.2%を達成し、ProではFable 5の80.0%にわずかに及びませんでした。SWE-bench Multimodalでは38.4%から59.4%への大きな飛躍が見られました。エージェントタスクが最も明確な勝利です。Opus 5はOSWorld 2.0で70.57%(Opus 4.8は55.7%)、Zapier AutomationBenchで26.0%(Opus 4.8は17.0%、Fable 5は17.4%)を記録しました。中程度の努力でも、タスクあたり0.89ドルで24%を達成しています。

推論に関して、AnthropicはOpus 5にツールやエージェントハーネスなしでIMO 2026の全6問題を解答させました。3つのモデルからなる審査パネルは、生成された24の解答すべてを正解と判定し、人間の専門家が問題ごとに事前指定された1つの解答を7/7と評価しました。最終的な42/42は金メダルレベルで、29/42のカットオフを上回ります。ARC Prize Foundationは、高努力でのARC-AGI-3スコア30.16%を検証しました。これは以前のリーダーボード最高スコアの約4倍です(GPT-5.6 Sol:7.78%、Opus 4.8:1.52%)。「人類最後の試験」では、Opus 5はツールなしで56.3%、ツールありで64.7%を記録しました。

マルチモーダル作業では、ツールが思考よりも効果的です。チャートグラフィーで、Opus 5はツールなしで29.6%、コンテナと画像クロップツールを使用して83.0%を達成しました。BenchCAD Vision2Codeでは、ボクセルIoUが0.366から0.821に向上し、ツールを使用した場合、Claude Mythos 5の0.678を大きく上回りました。

サイバー能力は向上しましたが、セーフガードは一部緩和されました。AnthropicはOpus 5をサイバーセキュリティタスクで訓練していませんが、一般能力の向上に伴い能力が向上しました。ExploitBenchのAutoNudgeアームで、Opus 5は平均10.14の能力フラグを獲得し、99の完全な任意コード実行エクスプロイトを生成しました(Mythos 5は132)。OSS-Fuzzでは、Opus 5は79.4%のターゲットで非ゼロスコアを記録し、Mythos 5は約80%でした。しかし、Opus 5は完全なエクスプロイトを4つ完了したのに対し、Mythos 5は13でした。このギャップはセーフガード設計を定義しています。Opus 5は脆弱性発見においてMythos 5とほぼ同等ですが、悪用においては大幅に劣ります。そのため、Anthropicはソースコードの脆弱性発見のみをブロック解除し、バイナリベースのスキャン、ペネトレーションテスト、エクスプロイト生成は引き続きブロックされています。分類器の介入頻度はFable 5と比較して約85%低下すると予想されます。英国AISIは初期チェックポイントを3つのサイバー範囲でテストし、Opus 5は「The Last Ones」を10回中8回エンドツーエンドで解決しました。「Doing Life」範囲は解決できませんでしたが、23ステップ中22ステップに到達し、テストされた他のモデルよりも先に進みました。

プロンプトインジェクションは際立った安全数値です。Gray Swan間接プロンプトインジェクションベンチマークで、15回以内の攻撃成功率はOpus 4.8の5.5%から2.0%に低下しました。Mythos 5は2.6%、GPT-5.6 Solは20.0%です。Claude Coworkを介したブラウザ環境では、攻撃成功率は31.5%から3.70%に低下し(セーフガードなし)、自動モードでは全129環境で0%に達しました。

総合的に見て、Claude Opus 5は価格を据え置いたまま、エージェントコーディング、推論、セキュリティにおいて飛躍的な進歩を遂げています。コミュニティの反応は概ね好意的ですが、AnthropicはOpus 4.8よりも事実上の幻覚がわずかに多いという否定的な側面も公表しています。このモデルは現在、Claude APIおよび各種プラットフォームで利用可能です。