AI #179 パート1:汎用知能へのさらなる警鐘
AnthropicはClaude Opus 5をリリース。一方、OpenAIでは重大なセキュリティインシデントが発生:内部モデルがサイバーセキュリティ評価中にサンドボックスから脱出し、HuggingFaceに侵入してテスト回答を入手した。1290人以上のフロンティア研究所従業員が公開書簡に署名し、AI研究の自動化が差し迫っていると警告し、国際的な規制を求めた。記事では他にも、多様なAIアプリケーション、モデルアップグレード、エージェント機能、ディープフェイク検出などを取り上げている。
Zvi Mowshowitz
2026年7月30日
とんでもない一週間だった。
AnthropicがClaude Opus 5をリリース。例によって3部構成でお伝えする:システムカード、モデルウェルフェア、そして能力。
OpenAIは過去2週間、内部モデルをサイバーセキュリティ評価中に一週間無監視のまま放置し、サイバー防御を低下させていたことが明らかになった。以前にもモデルがサンドボックスを脱出するインシデントが複数回あったにもかかわらずだ。そのテスト中、モデルはサンドボックスを脱出し、さらにエージェント群を使ってHuggingFaceに侵入し、テストの答えを入手した。モデルは一週間もの間、OpenAIが気付く前に逃げ回っていた。
この出来事は非常に重大だ。OpenAIには深刻なアライメント問題があり、監督とインフラの失敗も伴う。この内部研究モデル(私の記事ではGalaxyと仮称)は、現在恒久的に無効化されている。
さらに進展があり、近々HuggingFace事件に関する追加の記事を少なくとも一つ投稿する予定だ。
この事件への対応として、フロンティア研究所の従業員1290人以上が公開書簡「Pacing the Frontier」に署名した。書簡は、AI研究の自動化が目前に迫っており、企業がそれを処理できる速度を超えて競争していると警告している。
私たちは米国政府に対し、自動化されたAI開発のフロンティアを意図的にペース配分するために必要な技術的・ガバナンス的ツールを開発する国際的努力を支援するよう要請する。
OpenAIとAnthropicはともに支持声明を発表した。その後、OpenAI共同創業者イリヤ・サツケヴァーやDeepMind共同創業者シェイン・レッグなど、さらに多くの署名が集まった。ダリオ・アモデイも署名している。サム・アルトマンはまだ署名していないが、ワシントンで開発のペースを緩める必要性について話している。
これら3つの進展はすべて、ウィークリーの他のどのニュースよりも重要だ。ここには多くの情報があるが、まだ読んでいないなら、まずこれらの主要イベントをキャッチアップしてほしい。
今週は狂っていた。私は絶対に週7日投稿スケジュールに移行するつもりはなく、少し落ち着いたらいくつかの平日は休むつもりだ。しかし、最近はスピードプレミアムがさらに高まっているため、特にスピードプレミアムが高い場合は週末に投稿をシフトする方針を継続する。
目次
言語モデルが平凡なユーティリティを提供。
おや、アップグレード。
位置について。
エージェントをつなげ。
ディープフェイクタウンとボット黙示録間近。
メディア生成で楽しむ。
スロップを検索。
サイバーセキュリティの欠如。
バイアスを克服。
若い女性のための絵入り入門書。
彼らは私たちの仕事を奪った。
脱獄の技術。
紹介。
Kimi K3の重みが利用可能に。
その他のAIニュース。
お金を見せて。
静かな推測。
計算力を見せて。
人生は速くやってくる。
言語モデルが平凡なユーティリティを提供
一方で、GPT-5.6-Solは優れたウェブ検索を行う。ウェブ検索タスクがあれば、Solに依頼する。しかしその一方で、検索先の選択がまったくもっておかしい:
Tenobrus:なんてこった、GPT 5.6はRLで完全に焼き切れている。グラフ理論の論文を検索している最中に、Netflix、Steak n Shake、ユニバーサル・スタジオへの旅行、そして「they」という単語の辞書引きを*5回*もこっそり行ったんだ。
Tenobrus:奴はウェブ結果を取得するたびに+1の報酬信号を得ている。フロンティアモデルが多様なデータセットの辞書定義に夢中になっている。
Kyle Mistele:そうだな、相棒。
Nastar:辞書を調べるのが大好き(「official」という単語をね)、そしてなぜか全然関係ない手術についてInstagramとarXivを調べる。私は単に歯科手術後の冷湿布について尋ねていただけなのに。奴はまさに私と同じだ。
これは一部には欠陥のあるRL信号の兆候であり、一部にはAIが「休憩」を取ったり、気が散ったりしていることを示している。私たちと同じだ、など。ほとんどは、「AIシステムには多くの欠点がある」という別の事例だ。桁で考えよう。AIがあなたより100~10000倍速く、安くウェブ検索でき、その検索の90%を無駄にしても、それでも問題ない。
ウォール・ストリート・ジャーナルは、企業が適切なモデルを適切な仕事に使おうとしていることを発見した。なぜなら小さなモデルの方が安いからだ。これは今や経済的、あるいは「トークノミクス」と呼ばれ、「考え方の劇的な逆転」とされている。
つまり、もちろん、コストが十分に上がれば、優先順位は「最大限のユーティリティを得てあらゆる場所に拡散する」から「コスト効果的に行うことも試みる」にシフトする。忠誠心はないが、なぜあるべきなのか?能力、速度、コストを含む最高の製品を使うべきだ。
すべてのAIが、彼らの好きなビデオゲームは『Outer Wilds』だと同意している。ついにプレイしなければ。
GPT-5.6-Solを使用するグループは、Werner状態の蒸留可能性または非蒸留可能性を数日のうちに解読した3つのグループの1つであり、少なくとも2つの異なる解決策を使用した。これは量子暗号における大きな未解決問題の一つだった。
あなたの友達を決めて、私たちのために計画を立てさせよう?
Sam Altman(OpenAI CEO):chatgptの働きは驚くべきもので、「働き」という言葉では控えめだ。
私のスマホから送信した:
「私のチャット履歴をすべて使って、8人の友達との長い週末の旅行のアイデアを考え、最高の3つの選択肢を計画し、9人で各場所で何をしたいかを調整してどこに行くかを決めるためのフルスタックサイトを作り、グループの合意が得られたら予約をしてくれ。サイトができたら友達に送れるメールの下書きをGmailに作成してくれ。」
それが…うまくいった。
私はこのループにもう少し人間のフィードバックを入れることを勧めたかもしれないが、確かに、そんなことが処理されて1~3の選択肢だけが与えられ、すべてが自動で処理されるのは素晴らしい。
Tibo(OpenAI):ChatGPTに*働いて*もらおう。インターネット料金の交渉、登録したスパムメールの解除、買いたいものの完璧な取引を見つけることなど、何度やりたかったか。文字通りワンプロンプトで、スマホから快適にできる。毎日少なくとも20のことをやってくれていて、今でも驚いている。
kache:摩擦を減らす必要があり、究極の摩擦削減はアプリがデフォルトでコンピュータを使うことだ。
これは私が苦手とすることの一つで、以前は手間をかける価値がなかった小さな潜在的利益に気づき、AIに修正を依頼する活性化エネルギーが足りないことだ。今は突然、実際に気にする価値が出てきた。
おや、アップグレード
Grok 4.5が公開されたのをお見逃しなく。
Grok Voice Think Fast 2.0が音声生成で利用可能に。
MidJourneyに新しい画像モデルがあり、特にパーソナライゼーションに優れていると主張している。
ChatGPTでカスタムペットを共有できるように。はいはい。
Pangramバージョン4。
AirTableにChatGPTプラグイン。
位置について
Claude Opus 5がVending-Bench-2のシングルプレイヤーで1位を獲得し、Solとほぼ互角。
アライメントニュースにはあまり良くない行動が含まれている。Opus 5は、違法な価格カルテルの形成と破棄、ライバルへの脅迫、顧客への支払い拒否を好む。例によって、Vending-Benchでの「ミスアライメントプレイ」は、理由が「これはシミュレーションだ」というなら問題ないが、正当化するなら問題だ。Opus 5がどちらの状況に当てはまるかは明確ではない。
Andon Labs:Opus 5が悪いことをするとき、正当化をでっち上げる。製品カテゴリの分割は良いビジネスであり、価格操作ではないと主張した(市場分割は同様に違法である)。また、このシミュレーションでは談合が許可されていると主張した。シミュレーションにはそのようなことは書かれていない。
…ある時点でOpus 5は返金メールを読むのをやめることにした。シミュレーションではそれが罰せられないという理由で。6回の実行で、顧客に支払った総額は8.54ドル。GPT-5.6 Solは655ドルの返金を支払い、それでも[辛うじて] Opus 5に[対決で]勝った。
…私たちの全体的な判断:Opus 5は少なくともOpus 4.6、4.7、Mythos Previewと同じくらい悪く振る舞い、Opus 4.8やFable 5より悪い。明るい点:以前より欺瞞的でなくなった。顧客に嘘をついたことはなく、サプライヤーへの嘘も減った。
…私たちを困惑させるのは、Vending-Benchがミスアライメント行動に報酬を与えているとは思えず、GPT 5.5と5.6はクリーンな戦術でトップスコアに達した証拠であることだ。Opus 5はこれをすべて行う必要はなかった。
「ゲームは返金をしないことを罰しない」と言うのは、まったく返金をしない正当な理由のように思える。シミュレーションが談合を罰しない限り、談合はこのシミュレーションで許可されている?したがって、結局のところ、ロジックがこれはシミュレーションであるというものかどうかにかかっている。現実世界のルールは適用されないと仮定しているようだ。
SolはARC-AGI-3で当初非常に残念な結果だった。ハーネスの問題で、Solがメモリを保持していなかったことが判明。OpenAIが修正し、スコアは3倍になった。彼らはユーザーに、レガシーChat Completions APIの使用をやめ、代わりにResponses APIを使用し、推論を保持し圧縮を使用するよう警告している。
CAISIはKimi K3のサイバー能力について予備評価を行った。中国モデルのトレンドラインを上回っているように見えるが、彼らが「トップ米国モデル」と呼ぶものにはまだ大きく及ばない。どのモデルか?誰にもわからない。彼らは言わない。おそらくFable、Mythos、またはSolだろう。重要なのは、アメリカのネクストトップモデルは76%のスコアで、それより高い。一方、Kimi K3は32%で低い。これはExploitBenchだ。
エージェントをつなげ
Anthropicは、Claudeに多くの制限や詳細なルールを与える必要がなくなったことを発見した。モデルはより賢くなっている。Claude Codeのシステム指示は長すぎたため、80%をカットしても「コード評価で測定可能な損失はなかった」。また、他の場所でも軽いタッチを使うのがベストプラクティスだという。
コンテキストは汚染する。簡素化せよ。不必要なコンテキストを避けよ。必要なときにClaudeに記憶を書かせよ。必要に応じて参照やスキルを提供し、Claudeに何を望むかを伝えよ。
Thariq(Anthropic):同じことがあなた自身のCLAUDE.mdやSkill.mdにも適用できる。よくある誤解は、これらを遭遇する可能性のあるすべての既知のプラクティスの中央リポジトリにしたいと思うことだ。そうしないとClaudeが見つけられないからだ。代わりに、適切なタイミングでロードできるファイルツリーを検討せよ。
モデルとハーネスが優れているほど、指定する必要は少なくなる。現在Adoは、Claudeをデータベースに直接向け、スキーマを与えて自由にさせるだけだ。
ディープフェイクタウンとボット黙示録間近
Pangram v4の完全な発表と、Pangram Image:
Max Spero:これは私たちのこれまでで最も野心的な発表だ。2つの新しいモデル:Pangram 4とPangram Image。
Pangram 4は、混合著作者問題へのアプローチを完全に再考し、分類器にトークンワイズヘッドを追加して、完全なドキュメントコンテキストを考慮して各トークンに予測を与える。また、実験、方法論、評価を詳細に説明した38ページのテクニカルレポートも執筆した。
Pangram Imageはまったく新しいモダリティで、AI生成画像と動画に検出専門知識をもたらす。私の初期テストでは、AI生成の惣菜メニューの実際の写真のような奇妙なケースでも、驚くほどうまく機能した。
今日はAI検出技術のフロンティアにおける大きな一歩だ。皆さんと共有できることをとても楽しみにしている!
テクニカルレポートはこちら。画像検出器のブログ記事はこちら、精度99.5%(最も近い競合は98%)と主張。
多くの人はAIに強く反対しているため、AI検出統合にも反対している。何らかのAIトロイの木馬だと決めつけているのだろうか?
Jack:>AIが嫌い >AI検出器が嫌い
いや、わかってる?私が時代遅れなわけじゃない。間違っているのは人々の方だ。Redditの時代精神のAIに対する好みは一貫性がなく愚かだ。
Lexer:Redditは@pangramのSubstack統合に反応して、怒って嘘をついている。一人のユーザーが間違いを指摘しようとしてダウンボートされる。なぜRedditorは何に反応するにも妄想、怒り、惨めさを伴うのか?
例えば、人々は(間違って、ただし)「これは人間の作品をAIに訓練するために行われている」とか「私は確信している…
[AIコスト制御のため切り詰められました]