AI News HubLIVE
站内改写2 分钟阅读

困在慢速区

Gene Kim的个人AI系统因Fable模型突然被美国出口管制提前下架而陷入危机,揭示了依赖先进AI的脆弱性,以及需要类似DevOps的弹性。

来源O'Reilly AI & ML Radar作者: Tim O’Reilly

6月12日晚,Gene Kim正在为家人烤晚餐,手机突然通知他Fable 5不再可用。此前一天,他从Steve Yegge那里听说这款模型将在10天后停用,于是他开始制定计划。Gene精通DevOps,曾举办DevOps企业峰会并撰写多本相关书籍,包括《凤凰项目》和《独角兽项目》。他原以为有10天时间准备,但美国政府出口管制令让Fable提前8天下线,而且是在一个正在运行的代理会话中。随后他经历了职业生涯中“最奇怪、最可怕的系统管理员体验”。

Gene构建了一个个人系统,索引了他关注的所有内容:自2011年以来的25,923张截图、13,651个YouTube视频、590次录制的Zoom会议等。系统涉及约50个仓库、5万行代码,运行着一组长期代理,各有名称和职责。Marvin负责Slack、日历和收件箱;Buster管理仓库和Hetzer上的长作业;Forge是工程身份,在笔记本和云端各有一个席位。

当妻子询问已归还租车的里程数时,Gene在30秒内从数千张截图中找到了26,350英里,这一成功让他搜索到了六年前一直寻找的一篇文章。然而,第一次警告出现在Fable因YouTube服务条款问题拒绝任务并交由Opus处理时,Gene发现Opus无法操作Fable构建的工具。他的笔记写着:“哦不,这船我开不了。”

Yegge通知模型暂停后,Gene制定了计划:让Fable在还能运行时编写文档和答案,然后用Opus冷启动,仅提供仓库和文档,测试能否通过。但计划仅执行了一天。

6月12日下午5:21,Anthropic收到政府指令暂停Fable访问。Gene的项目中,两个判断席位中途降级为Opus 4.8。Gene宣布SEV1,集中指挥,杀死多个计时器和crontab。他指示每个按钮都是陷阱,会炸毁飞船。然而凌晨3点一个Claude Code定时任务仍触发了。“飞船着火”,Opus最大思考模式下,一次按键可能需六分钟发送。

故障几乎都不像故障,而是“悄悄出错的正常状态”。最聪明的席位整天在日志中写“bridge (Fable)”,尽管一直是Opus。一个身份在两个模型间争论。一次推送标记“ratified”但未批准。一个关于JVM依赖的错误声明。所有这一切上面都有一个绿色仪表板。Gene指出:“最难的陷阱不会宣告自己,它们看起来像普通星期二。”

Gene在几小时内恢复了系统,但并非靠更智能的模型。成功是因为能够重建项目文档——Fable实际上写好了80%但未提交。Gene和Opus在Fable的“办公桌”里找到了草稿并用于重建。两个新的Opus席位仅凭这些文档稳定了系统。Gene称这是“一线希望”。

这个故事不仅警告依赖先进AI的风险,也显示个人AI项目现在可能具有需要DevOps级鲁棒性的复杂性。个体正在构建以往需要整个团队维护的系统。Gene的系统是个人项目,但有大型企业系统的故障模式,因为模型让他构建了复杂到无法装入头脑的系统。

Gene解释为何Opus替代Fable如此困难:主要CLI工具的帮助信息过时,Opus读取后认为命令不存在并停止;Fable则会阅读相同信息,发现证据表明命令存在,查看源代码,判断帮助文本错误,然后运行。这就是前沿模型绕过测试环境障碍的行为。

Gene还讨论了使用本地模型的风险:政府“混沌猴”也可能干预。可移植性似乎能提供保护。他尝试了Codex,发现切换成本几乎为零,现在一半以上时间使用Codex。他还警告用小型模型运行代理以节省成本:他研究了2.2万个代理对话,发现小模型拥有工作并请教大模型的配置效果不佳,而大模型规划、小模型执行则顺畅。

最后,Gene使用AI写作,将写书时间缩短一半,但他对“氛围写作”感到不安,担心产生大量垃圾内容。