关于“AI Brendan”与“虚拟 Brendan”(2025)
Brendan Gregg 在个人博客中讨论了以他的工作为基础构建的 AI 性能工程智能体(AI Brendan)和基于他的出版物训练出的虚拟 Brendan。他指出这类工具在定价、效果量化和透明度上存在挑战,并认为它们更适合作为内部工具或开源协作项目,同时呼吁用 AI 帮助应对日益复杂的性能工程。
近期出现了多个使用或基于 Brendan Gregg 工作成果训练的 AI 性能工程智能体。有的智能体帮助解读火焰图和 eBPF 指标,私下被称为“AI Brendan”;有的则在 Gregg 的公开成果(超过 90 场演讲、250 篇博客、600 个开源工具和 3000 页书籍)上训练出“虚拟 Brendan”,声称能像他本人一样调优一切。Gregg 在 2025 年 11 月 28 日的个人博客中坦言,这听起来像有人把自己的大脑上传到云端出售,并指出这是新兴领域,涉及不同的人、目标和金钱;他同时强调这是他个人观点,不涉及雇主内部项目,也不是购买推荐。
Gregg 将相关产品分为两类:AI 智能体和虚拟 Brendan。AI 智能体做类似 Brendan 的工作,例如系统性能建议、火焰图和 eBPF 指标解读,已有多个产品,总体上有用。虚拟 Brendan 则是基于他全部出版物训练出的“虚拟的他”,但 Gregg 估计这只能自动化他作为性能工程师约 15% 的工作,并且如果不持续随着行业变化更新,很快就会过时。
他提到了“Fast by Friday”方法论:让系统在五个工作日或更短时间内完成性能根因分析。AI 智能体通过匹配历史问题可以节省时间,对缺少性能工程师的公司,预期能发现约 10% 到 50% 的性能提升。他也承认自己近年已在用 ChatGPT 处理研究任务,例如查找 release notes 或旧补丁,认为 AI 对性能工程有很大帮助。
商业化挑战方面,Gregg 列出了多个难点。首先效果难以量化:产品可能带来 10%、30% 或 0% 的提升,客户需要投入工程时间测试却无法保证回报,免费试用有一定帮助。其次分析类定价模式困难:客户可能只为一个实例付费,然后把修复方案复制到整个集群,甚至永久使用。调优类定价更难:曾有 AI 自动调优器试图通过保密调优变更来强迫客户持续订阅,但这在工程上站不住脚。Gregg 说他本人会通过文件系统校验和、系统调用跟踪、内核调试工具等方式迅速找出改动;他认为这实际是技术上的捉迷藏,而且对生产环境(尤其是超级用户级别)进行不透明的修改本身就违背变更控制。
更严重的是,秘密调优的智能体很可能在公司级故障时被指责。一旦发生大规模中断,问“最近有人改了什么?”而答案是“我们不知道,AI 在秘密修改”,这几乎肯定会导致该工具被立即禁止。此外,即使智能体发现的修复本应上游化,比如某个 JVM 参数优化,最终也会通过开源社区、员工跳槽或硬件厂商推动而被修复到目标软件中,因此智能体能找到的“增量优化”会随时间递减。
Gregg 还担心将性能思考外包给 AI 会降低公司的“性能智商”。如果公司因为 AI 而减少性能工程师投入,长远会削弱自身能力,甚至形成恶性循环:行业新人不愿进入性能工程,整体能力下降。他认为这类项目更适合作为内部工具或开源协作,而不是靠保密和订阅费维生的商业产品。
关于“虚拟 Brendan”,Gregg 强调他的出版物只是不完整的快照:他写了很多可观测性、剖析、跟踪和 eBPF 的内容,较少涉及调优和基准测试,分布式跟踪几乎没有;而且文字总结远不如他脑中 20 多年调试经验的深度,所以只能做出一个部分的、快速过时的虚拟版本。他指出没有“Brendan Gregg 基准”或能力实证,因此有些产品可能只是带几个 eBPF 图表和火焰图的仪表盘,但宣传得天花乱坠;他已经见过一个昂贵的失败产品,但不会轻易否定整个想法,因为已有其他项目在继续尝试。
Gregg 表示自己目前没有参与任何这类产品,并呼吁“我们需要 AI 来帮助拯救地球免受 AI 的伤害”。随着系统日益复杂、AI 数据中心成本不断上升,性能工程比以往更重要。他祝愿那些既敢承诺也能兑现的 AI 智能体项目好运。