为什么AI工具会让某些团队变慢
本文探讨了AI编程助手在团队层面可能反而降低效率的现象,分析了DORA 2024报告和MIT斯隆研究,指出个人效率提升与团队交付下降的悖论,并提出了成功利用AI的团队所具备的关键实践。
本文是《超越编程助手》系列的第二篇,该系列专注于企业级AI辅助软件工程。完整系列可在https://articles.zimetic.com免费阅读。
当两个团队在同一季度部署相同的AI编程助手——同一供应商、同一模型、相同席位数量——结果可能截然不同。一个团队交付更多,事故更少,工程师更满意;另一个团队交付量甚至低于工具引入之前。拉取请求积压等待审查,测试不稳定,部署停滞。工程师上下文切换更频繁,睡眠更差,甚至开始在LinkedIn上讨论“AI疲劳”。
两种结果的差异不在于AI本身,而在于AI加速推动的一切——那些AI没有改变、但现在必须跟上步伐的事情。
数据显示的矛盾
最可信的数据来自2024年DORA加速状态报告。DORA是衡量软件交付性能的行业标准框架,涵盖吞吐量、稳定性、恢复时间和变更失败率。2024年报告专门用大量篇幅讨论AI采用,并得出了一个令人不安的发现。
在个人层面,AI看起来是明显的胜利:75.9%的受访者表示依赖AI完成部分工作,75%报告个人生产力提升。流程改善,工作满意度提高,人们喜欢这些工具。
但在组织层面,情况反转。DORA的模型发现,“AI采用率增加25%与交付吞吐量下降约1.5%、交付稳定性下降7.2%相关”。个人开发者感觉更快,但团队交付却变得更不可靠。这两句话来自对同一团队进行的同一调查。
麻省理工学院斯隆管理学院和微软的最新研究为这种差距提供了理论框架。在《任务链、重新定义工作:AI自动化理论》中,Shahidi等人认为,AI的价值体现在工作流层面而非任务层面,并且达到这一价值存在阈值效应。“在达到该阈值之前,采用AI的成本超过收益”,主要作者Peyman Shahidi在2026年4月告诉MIT斯隆。只有当团队围绕AI进行重组后,可衡量的收益才会出现。DORA的异常现象正是阈值前区域在生产中的表现:个人任务加速,而团队级工作流仍按旧流程运行,因而落后。
Gene Kim和Steve Yegge的《氛围编码》(2025)将此称为“DORA异常”,并将其视为其框架——FAAFO(快速、雄心勃勃、自主、有趣、可选性)及相关实践集——提出的核心动机之一。他们并非说AI不好,而是说没有正确实践支撑的AI会可靠地产生DORA所测量的模式。
为什么更快的编码会让团队变慢
机制如下:当前端编码步骤加速而下游没有相应升级时,瓶颈不会消失,只会转移。
更多代码意味着更多审查负担。更多审查负担意味着拉取请求延迟增加。更多等待中的拉取请求意味着审查者更多上下文切换。更多上下文切换意味着更多错误被漏过,因为人类注意力是有限资源,Gloria Mark的23分钟中断恢复时间仍然成立。更多错误意味着更多事故,更多事故意味着更多待命中断、事后分析和重建管道信任的时间。每个因素都会放大其他因素。
MIT斯隆论文进一步阐述了这一点。每次AI与人类之间的交接都伴随着协调成本——审查、验证、调整——而AI任务接着人类任务的工作流在每个步骤都积累这些成本。端到端工作流如果将相邻的AI友好任务聚类在一起,则可以避免交接税。“更多代码,更多审查,更多上下文切换”的级联就是交接税的显化。
在AI到来之前,“编码”部分已经只占总吞吐量的一小部分。孤立地加速它几乎不会提高上限,甚至可能因消耗下游步骤的能力而降低上限。
这并非新机制,而是应用于软件交付的阿姆达尔定律,以及应用于协调工作的约束理论。加速一个非主导阶段会导致瓶颈转移;如果新瓶颈比旧瓶颈更差,总吞吐量就会下降。
赢家与输家的区别
从AI工具中获益的团队通常拥有或快速形成一组特定的实践。氛围编码称之为基本技能;类似的想法也出现在DORA自己的推荐以及关于AI增强开发的日益活跃的文献中。核心包括:
- 架构思维:有人负责系统整体形状,而不仅仅是当前差异。AI生成的代码不会默认采用良好架构;它默认为“提示所暗示的任何内容”。从AI中获益的团队拥有人类保持整体结构连贯性,随着变化速度加快而调整。
- 快速反馈循环:测试、CI和预览环境在几分钟内运行,而不是几小时。在人类编码速度下令人烦恼的45分钟CI周期,在AI编码速度下变得灾难性,因为传入变更的速度压倒了验证步骤。Kent Beck——极限编程的原创者——自2025年以来一直明确表示,TDD在与AI代理配对时成为“超能力”。TDD和XP实践感觉像是2005年的复兴,但它们正是实现快速反馈循环的实践。
- 清晰的代理通信协议:代理获得什么上下文,返回什么,交接如何发生。获益的团队将代理交互视为API调用——版本化、文档化、规范化。挣扎的团队将其视为自由形式的聊天。
- 依赖管理和小型、边界清晰的工作项:AI代理擅长小型、明确指定的工作,不擅长大型、模糊、多步骤的工作。获胜的团队为AI工具提供合适大小的任务;挣扎的团队用一个提示要求完成三个人的工作。
- 行动独立性与协调纪律的平衡:工程师需要自由探索工具,同时也需要足够的共享结构,使探索不会碎片化代码库。“每个人按自己意愿使用AI”感觉像是自主,但会产生无人能审查的代码库。
失败团队缺失的东西
镜像:没有明确的架构所有权;缓慢或不稳定的反馈循环被AI的吞吐量增加所淹没;临时提示没有共享约定;工作项太大、太模糊或耦合太紧,AI或人类都无法干净地推进;文化上视“工程师按自己意愿使用AI”为自主,而实际上是一种拒绝协调。
工具会放大团队已有的实践。如果这些实践很弱,工具会使弱点更快显现。
这不是工具或工程师的错
失败模式是结构性的。团队以校准到AI之前编码速度的节奏运行其软件开发生命周期。当前端加速而其他部分不变时,系统会变得更糟,且从内部难以察觉。工程师感觉更高效(他们写了更多代码!),但团队生产力更低(交付更少,漏洞更多)。
现在工程师每天上班面对堆积的拉取请求,感到不知所措,无法理清所有变更,也不知道这个拉取请求到底在做什么。压力水平不断上升,所有故事都在等待他,工作变得不那么有趣,更加令人沮丧。
正确的工具与正确的流程
如果我们能够结合加速整个生命周期的工具与减少团队成员上下文切换负担、减少积压的流程,那么我们就能实现AI所承诺的团队级性能提升。
更多代码不等于更高生产力。交付更多工作才是,而交付工作是整个团队的成就。下一代AI工具必须认识到这一点。
下一篇
在下一篇文章《廉价AI的终结》中,经济背景将收紧。打包的企业令牌正在被淘汰。电价、内存价格和硬件供应都朝着不利于“只管消耗令牌”的方向发展。那些依赖大量廉价令牌来掩盖实践差距的团队即将失去这一缓冲。
来源
- DORA | 2024年加速状态报告
- 2024年DORA报告显示AI的利弊——InfoQ
- AI如何重塑工作流和重新定义工作——Kristin Burnham,MIT斯隆,2026年4月
- 任务链、重新定义工作:AI自动化理论——Shahidi、Demirer、Horton、Immorlica、Lucier
- 氛围编码:使用生成式AI、聊天、代理等构建生产级软件——Kim、Yegge、Amodei(IT Revolution,2025)
- AI驱动开发生命周期:重新构想软件工程——Raja SP
- 信任AI,Kim和Yegge的新编码宣言——The Register
- TDD、AI代理与Kent Beck编码——The Pragmatic Engineer
- 开发者系数——Stripe,2018
- 中断工作的成本——Gloria Mark等,CHI 2008