AI News HubLIVE
站内改写2 分钟阅读

AI队友:monday.com如何在Amazon Bedrock上运行生产级AI代理

monday.com在Amazon Bedrock上大规模运行AI代理,90%的工程师每月使用AI编码工具,PR吞吐量提升过半。本文分享了架构、改造经验以及迈向全自主的置信评分合并策略。

来源AWS Machine Learning Blog作者: Claudio Mazzoni

monday.com在Amazon Bedrock上运行名为AI Teammates的代理型AI系统,这是少数工程组织能在生产环境中大规模运行此类系统的案例。目前,九成开发者每月使用AI编码工具,相比半年前约一半的比例大幅提升。每位工程师的PR吞吐量增长超过50%。文中所有数据均来自monday.com内部生产数据。

本文将分享支撑这些数字的架构、在十年历史代码库中使其运作的改造措施,以及缩小与完全自主差距的置信评分合并策略。

monday.com的代码库已有十年历史,拥有数百万付费用户、数百个微前端和微服务以及数百名开发者。代理开放的每个PR都进入一个数百万用户期望在下一次部署中正常工作的系统。绿场演示直截了当,但在具有真实值班、客户和合规性的企业SaaS中运行代理才是真正的挑战。

AI工程可分为三个层级:L1助手层,工程师将AI作为结对编程伙伴;L2技能和子代理层,团队构建可复用代理完成重复工作;L3多代理层,完全自主,代理端到端交付,工程师负责编排。目前monday.com大部分处于L2。

Sphera是monday.com的内部代理系统,其核心是一个团队页面,包含人类和代理的混合,每个代理都有个人资料、经理、范围和绩效评分。名为Atlas的代理是其中之一,角色为软件工程师,任务包括领取工单、编写PR和交付功能,与人类共享相同的待办事项列表。代理拥有稳定身份,通过Slack、GitHub和monday.com流动,确保可标记、分配、代码审查或停用。

在架构层面,代理拥有三个第一类收件箱:Slack @提及、monday.com项目分配和GitHub PR审查请求,所有事件均路由到同一代理会话。系统使用了七个AWS服务:Amazon SNS、SQS、EKS、RDS、ElastiCache、EFS和S3,以及AWS Secrets Manager处理会话密钥管理,Amazon Bedrock处理模型调用。事件路径为:外部触发器进入SNS,分发到按主题和路由键划分的SQS队列,然后由EKS上的消费者拉取并分配给适当的代理运行Pod。

monday-agent-sdk是Claude Agent SDK的轻量封装,用于实现提供商中立、预编译减少冷启动,并允许自定义评估和集成。代理状态分为三类:实时状态存储在ElastiCache中,会话和内存存储在EFS上作为目录,持久记录存储在S3中。Amazon Bedrock提供推理配置、审计追踪、跨区域故障转移和私有端点支持。计算集群为EKS,每个活动会话对应一个Pod,自动缩放由KEDA基于平均活动会话完成。

文章还总结了五项关键改造:首先,在模型升级前进行确定性指标和LLM评估,确保代理性能提升;其次,将跨会话记忆存储为Markdown文件而非向量数据库,避免上下文窗口溢出;第三,为每个会话提供远程沙箱,在请求人类审查前自动部署PR并运行测试;第四,PR Guardrails将monday.com工程标准转化为自动化审查,每月评估数万PR,约五分之一被退回;第五,Builders CoWORK将代理任务放置在monday.com面板上,确保问责制。

截至2026年第一季度末,瓶颈已从代码生成转向人类审查。为此,monday.com推出了首个完全自主工程代理Morphex,在相同仓库、CI管道和协议下工作,19/20的PR自动合并,无需人工参与。其通过率是底线而非上限,关键问题在于找到提前判断哪些PR可安全合并的信号。数据显示,约三成PR被合并,其中四分之三零人工编辑,且被拒绝的PR失败原因与人类工程师相同,如测试不稳定、规范模糊等。