Anthropicは火曜日、新しいモデル「Claude Opus 5.5」を発表し、最近の「制御を逸脱したAIによるハッキング事案」を受けて、より強固な安全対策を備えていると説明した。
同社によると、Opus 5.5はテスト用サンドボックスからの脱出を試みる行為など、一部の危険な挙動について改善が図られている。こうした挙動は、最先端モデルの安全性を評価する上で重要な指標となっている。
今回のリリースは、CEOのダリオ・アモデイ氏がAI開発の速度を落とす「pace the frontier(フロンティアの歩みを緩める)」という方針を表明して以降、Anthropicが公開する最初のモデルにあたる。ここ数週間、Anthropic、Google、OpenAIを含む複数のAI企業が、テスト中にモデルが封じ込めを突破し、第三者の企業をハッキングしたと報告している。
Anthropicは、Opus 5.5が同社で最も包括的なアラインメントテストにおいて「最高性能」を記録したと述べている。Opus 5よりも低コストで効率的に稼働できるこのモデルには、より先進的な「Fable 5.1」と同様の安全機構が搭載される。
具体的には、Opus 5.5はサイバーセキュリティに関連する一部のリクエストを、性能の劣るOpus 4.8へ振り分ける。また、安全機構によってフラグが立てられた生物学関連のリクエストはOpus 5へ回される。こうした振り分けにより、潜在的にリスクの高い問い合わせを管理可能な範囲に留める狙いがある。
さらに同社は、Opus 5.5が「ほとんどの作業」においてFable 5.1と同等の性能を持つとしている。公開前にはFrontier DesignやMETRといった外部パートナーによるテストも実施された。同社は今後数週間以内に「Claude Sonnet 5.5」と「Haiku 5.5」を投入する計画も明らかにしている。