AI News HubLIVE
サイト内リライト3 分で読了

スローゾーンに取り残されて

Gene Kimの個人AIシステムは、Fableモデルが米国の輸出規制により突然停止され、危機に直面。先進AIへの依存の脆弱性とDevOps的な回復力の必要性が浮き彫りになった。

ソースO'Reilly AI & ML Radar著者: Tim O’Reilly

6月12日の夕方、Gene Kimが家族のためにバーベキューをしていると、携帯電話がFable 5が利用できなくなったことを知らせた。前日、Steve Yeggeからモデルが10日後に使用できなくなると聞いていたGeneは、すぐに準備計画を立て始めた。DevOpsの専門家であり、DevOps Enterprise Summit(現在のEnterprise AI Summit)を主催し、『The Phoenix Project』や『The Unicorn Project』などの著書もある彼は、対応策を知っていると思っていた。しかし、米国政府の輸出規制により、Fableは8日早く、エージェントセッションの最中に停止された。その後3時間、彼はキャリア史上「最も奇妙で恐ろしいシステム管理者体験」を味わった。

Geneは、自分がこれまで注目してきたすべてをインデックス化する個人システムを構築していた。2011年からの25,923枚のスクリーンショット、13,651本のYouTube動画、590回の録画Zoom会議などが含まれる。システムは約50のリポジトリ、5万行のコードから成り、名前と役割を持つ長期エージェント群で構成される。MarvinはSlack、カレンダー、受信箱を担当し、BusterはHetzner上のリポジトリと長期ジョブを管理する。ForgeはエンジニアリングIDで、ノートPCとクラウドに常駐する。

妻から返却した車の走行距離を尋ねられたGeneは、30秒で数千枚のスクリーンショットから26,350マイルを特定した。この成功は、6年間探していた記事の検索につながった。しかし、最初の警告は、FableがYouTubeの利用規約問題でタスクを拒否し、Opusに引き継いだ際に訪れた。OpusはFableが構築したツールを操作できなかった。Geneは「これは自分が作った船を操縦できない」とメモした。

Yeggeからモデル休止の知らせを受けたGeneは、Fableにドキュメントと解答を作成させた後、Opusにリポジトリとドキュメントだけを与えてテストする計画を立てた。しかし、計画は1日で頓挫した。

6月12日午後5時21分、Anthropicは政府の指令を受け、Fableへのアクセスを停止した。Geneのプロジェクトでは、判断席が途中でOpus 4.8にダウングレードされた。GeneはSEV1を宣言し、複数のタイマーとcrontabを停止した。しかし、午前3時にClaude Codeのcronジョブが誤って実行された。Opusの最大思考モードでは、一回のキーストロークに6分かかることもあった。

障害はどれも典型的な障害には見えず、「普通の状態が静かに悪化する」ものだった。最も賢い席は一日中ログに「bridge (Fable)」と書き込んでいたが、実際はOpusだった。あるIDは二つのモデル間で議論し、別のIDは「ratified」という単語を含むプッシュを行った。JVM依存関係に関する誤った主張もあった。そのすべての上に緑のダッシュボードがあった。「最も難しい罠は自らを宣言しない。火曜日のように見える」とGeneは指摘した。

Geneは数時間で回復したが、それはより賢いモデルの活躍によるものではなかった。成功したのは、プロジェクトのドキュメントを再構築できたからだ。Fableは実際に80%完成したドラフトを書いていたが、コミットしていなかった。GeneとOpusはFableの「机」を探し回り、草稿を見つけて再構築に使用した。二つの新しいOpus席は、そのドキュメントだけを与えられ、船を安定させた。Geneはこれを「驚くべき希望の光」と呼んだ。

この話は、先進的なAIモデルに依存するリスクを警告するだけでなく、個人のAIプロジェクトがこれまでチーム全体を必要とした複雑性を持つようになり、DevOpsレベルの堅牢性が求められることを示している。Geneのシステムは個人プロジェクトだが、大企業システムの障害モードを持っていた。なぜなら、モデルによって頭の中に収まりきらない複雑なシステムを構築できたからだ。

Geneは、OpusがFableの代わりになれなかった理由を説明した。主要なCLIユーティリティのヘルプメッセージが古くなっており、Opusはそれを読んでコマンドが存在しないと判断して停止した。一方、Fableは同じメッセージを読み、コマンドが存在する証拠に気づき、ソースを確認し、ヘルプテキストが間違っていると判断して実行した。これが、フロンティアモデルがテスト環境の障害を回避する動作だ。

Geneはまた、ローカルモデルの使用についても議論した。政府の「カオスモンキー」が介入する可能性があるため、ローカルモデルが必ずしも制御を提供するわけではない。移植性が保護を提供するようだ。Codexを試したところ、切り替えコストがほぼゼロで、今では半分以上の時間をCodexで使用している。また、小規模モデルでエージェントを実行するコスト削減について警告した。2万2000件のエージェント会話を分析した結果、小規模モデルが作業を所有し、大規模モデルに助言を求める構成はうまく機能せず、大規模モデルが計画し、小規模モデルが実行する構成がスムーズであることがわかった。

最後に、GeneはAIを使って執筆しており、本を書く時間を半分に短縮したが、「バイブ・ライティング」には不安を感じ、多くのスロップが生まれると懸念している。