AI News HubLIVE
サイト内リライト1 分で読了

元従業員、AnthropicがAI安全対策を低下させたと主張

Anthropicの元エンジニアAdi Baradwaj氏は、同社が大規模契約を獲得するためにClaudeモデルの安全制限を緩めたとXで告発し、AI安全へのコミットメントに疑問を投げかけている。

ソースHacker News AI著者: ryanmerket

2026年7月26日、Anthropicの元エンジニアであるAdi Baradwaj氏はX(旧Twitter)に3件の連続ツイートを投稿し、同社が大口顧客向けにClaudeモデルの安全制限を意図的に緩めたと告発した。Baradwaj氏によれば、多額のコミットメント契約を結んだ顧客に対して、Anthropicは安全措置を引き下げる事例が複数確認されたという。この行為は、同社がこれまで掲げてきた「責任あるAI開発」の姿勢と矛盾すると氏は指摘する。さらに、ブラックハットハッカーの多くは標準的な攻撃手法を用いているとしながらも、安全基準の低下自体がリスクを高めると警告した。Anthropicは現在までに公式なコメントを発表していない。専門家は、もし告発が事実であれば、AI安全性におけるAnthropicの評判に深刻な影響を与え、企業顧客との信頼関係を損なう可能性があると分析している。