AI News HubLIVE
站内改写2 分钟阅读

AI、火箭与硬合同的回归(第一部分)

本文探讨了AI辅助开发中的经济错配问题:AI使实现代码变得便宜,但判断、经验和整合依然昂贵。通过对比美国阿波罗登月计划和苏联N1火箭项目的工程方法,作者提出应将AI生成视为“发动机车间”式的快速迭代试错,而非“阿波罗”式的昂贵预审。然而,软件缺乏物理世界的“判决者”(如物理学),因此需要利用编译器、类型检查器、数据库约束等“硬判决”机制来筛选代码,同时设置“防爆墙”限制错误损害。最终,AI加速开发后,人类评审成为瓶颈,需要改变评审方式。

来源Hacker News AI作者: handfuloflight

本文分析了AI辅助软件开发的经济学实质。普遍认为“AI使软件变便宜”的说法在多数重要方面是错误的。AI真正降低的是实现成本:将决策转化为可工作代码的过程。但围绕该过程的所有其他环节——决定系统应该做什么、定义组件如何配合、划定安全边界、判断生成结果是否真正有效——仍然保持原有成本。AI可以快速生成大量代码,但判断、品味和经验仍然昂贵。这种错配是AI辅助开发的核心经济事实:AI生成代码的速度远超人类对其进行有意义的评估,且大部分生成内容看似合理但平庸,甚至潜藏问题。

为了找到可能的替代方案,作者转向一个意外的领域:火箭发动机。通过对比美国阿波罗计划和苏联N1火箭项目,揭示了两种工程信任方式:阿波罗通过巨额投入在发射前建立信心(建模、审查、测试等),而苏联发动机工坊则通过频繁的实物测试和迭代来积累知识(建造、点火、检查、修改)。阿波罗方式适合资源充足且要求极高可靠性的场景,而发动机车间方式则适合资源受限但需要快速进步的场合。

然而,软件没有物理世界的客观审判者。一段代码可以编译通过却毫无用处,一项服务可以满足API契约却实现错误业务逻辑。因此,不能简单地将AI生成的大量代码视为需要人类逐一审阅的珍贵成果。作者提出,应像发动机车间那样,将生成视为廉价的候选过程,而将严格的评审和筛选放在关键节点。软件虽无物理判官,但存在众多“硬判决”机制:编译器、类型检查器、数据库约束、事务、接口定义、状态机、权限边界、资源限制、沙箱等。这些机制能自动拒绝大量错误实现,而无需人类阅读。

关键在于,不要将AI生成的“废料”倒入阿波罗式的审查流程,期望人类能跟上。而应学习发动机车间的做法:大量生成、快速试错、丢弃失败品、再次尝试。同时,要吸取N1的教训:组件成功并不自动组成系统成功。应在意义重大和需要集成的地方投入昂贵的确定性,而在其他环节采用廉价的破坏性迭代。

当AI被引入传统工作流时,实际发生的情况是:测试失败、提交问题、AI生成补丁、人类审查。若AI生成补丁的速度比人类阅读快十倍或百倍,审查队列将成为整个系统的吞吐量瓶颈。而AI输出看似合理,使得审查者需要重构其假设、寻找遗漏边缘情况、注意被悄悄弱化的约束,这比审查人类代码更困难。因此,需要重新设计工作流,将评审重点从逐行阅读转为利用自动判决机制筛选,并接受一定程度的错误,但确保错误发生时廉价且可快速学习。