AI News HubLIVE
站内改写3 分钟阅读

将判断力用在关键之处:我们如何构建AI原生的交付流程

本文探讨了如何在AI工具普及的环境中保持人类判断力,提出了一个结构化的交付管道,将人类注意力集中在关键决策上,而其余部分由自动化的质量门控强制执行。作者基于在金融科技领域的实践经验,描述了从需求挑战到实时验证的完整流程,并讨论了其成本与收益。

来源Hacker News AI作者: moystard

本文作者基于在金融科技领域一年的生产级AI应用构建经验,提出了一个应对“认知债务”的解决方案。所谓认知债务,是指因过度依赖模型代替思考而导致的判断力缓慢丧失。作者认为,解决之道并非减少工具使用或强迫保持警惕,而是建立一种结构化的交付管道,将人类判断力集中在真正值得关注的思考和决策上,其余部分由自动化的质量门控强制执行。

在传统工程中,工程能力是约束条件,路线图受限于团队承载能力。而在智能体工具普及的今天,一个小团队就能完成过去一个部门的工作量,但判断力的供给并未增加。因此,工程领导者的核心工作转变为决定人类注意力的投向,并构建保护和支持这种注意力的系统。

作者指出,不加控制地使用AI具有欺骗性:初期效果很好,产出丰富,速度提升,但潜在问题会随着时间累积并突然爆发,表现为难以修复的代码缺陷和团队对代码库的陌生感。这种“认知债务”与技术债务最终合二为一,其成本被延迟,在不知不觉中增长,最终一次性偿还。

为此,作者所在团队运行着一个模拟交付团队角色的管道,从工单到实现再到发布变更,每个交接点都设有质量门控。流程从编写工单开始,工单采用用户故事和验收标准的形式,然后系统会自动挑战其范围,指出与现有系统的不一致,揭示空白并提出争议性问题。与此同时,工程师完善工单和技术设计,任何诊断都遵循数据优先原则。

实现阶段采用测试先行方法,在编写一行生产代码前就锁定行为。实现完成后,一系列并行审查独立进行:检查变更是否符合验收标准、项目架构和约定、API契约稳定性、安全性及供应链,最后还有一个简化环节,用于去除不必要的复杂性。所有审查自动执行,无需人工记忆。

最后一步是实时验证:一个智能体在真实环境中运行变更,驱动实际用户界面,检查数据库副作用和日志,不仅测试正常路径,也测试异常路径。验收标准在运行系统上得到验证,超越了代码测试层面。至此,一个丰富的拉取请求被创建,其合并受独立智能体重新审查、持续集成通过和人工明确批准的约束。

“启动”命令接受一个工单,从范围挑战到合并拉取请求,全程人类注意力仅集中在两个节点:在开始前在产品与工程层面塑造工作,以及处理门控升级上来的争议性决策。那些曾经耗费整个审查周期的微小实现细节,永远不会到达人类面前。

这种方法通过双重反转避免了认知债务:首先,它将仍需人类完成的思考集中起来,每个人行使的判断力都得到充分关注;其次,门控是结构性的而非可选的,质量和速度不再冲突。当质量检查成为下一阶段依赖的步骤而非需要记住的品质时,速度与安全并行不悖。系统还会记住团队惯例,经验教训一次性记录并生效,偏好成为护栏而非隐性知识。

这些门控并不减慢速度,它们消耗的是机器时间而非人类注意力,在人们处理下一项工作时并行运行。采用这种方式,三名工程师在六周内将一个新产品从概念推向公开发布,该平台每月处理数百万金融事件,且不允许对客户出现任何错误数字。作者认为,以这样的标准达到这样的速度,对于这种规模的团队而言,别无他法。

当然,这种模式也有成本:构建和调整管道需要时间,门控编码了团队的惯例和架构,代码库需要精心设计并由人员决定,管道需维护实时验证环境。最大的未解问题是如何培养初级工程师的判断力:在一个将他们从以往用于培养判断力的繁琐工作中屏蔽出来的系统内,他们如何成长?作者认为这是AI时代工程领导中最棘手的问题,需要集体解决。

最后,作者对工程领导者和其他工程师发出呼吁:采纳智能体编程已不再是问题,工具无处不在,其影响不可否认。真正的分界线在于那些有控制地使用工具的团队,与那些默默积累着隐藏在延迟中的债务而仪表盘依然光鲜的团队。对于领导者,有效的路径需要比热情或谨慎更多的设计努力:决定哪些决策需要人类判断,构建将那些决策路由给人类的结构,将其他所有质量属性变为门控。结果是每个人以为是权衡的组合:更快的交付、更少的债务,以及因持续使用而变得更加敏锐的判断力。对于工程师,门控就是技能,是编码团队知识的文件,任何人都可以编写和改进。一个值得明确界定的边界是:这里的一切都关于正确构建事物,而是否构建正确的事物则是另一门学科,没有管道能为你回答。

随着工具不断进步,结构将决定它们让团队更有能力还是仅仅更多产。