AI News HubLIVE
站內改寫2 分鐘閱讀

AI隊友:monday.com如何在Amazon Bedrock上執行生產級AI代理

monday.com在Amazon Bedrock上大規模執行AI代理,90%的工程師每月使用AI編碼工具,PR吞吐量提升過半。本文分享了架構、改造經驗以及邁向全自主的置信評分合並策略。

來源AWS Machine Learning Blog作者: Claudio Mazzoni

monday.com在Amazon Bedrock上執行名為AI Teammates的代理型AI系統,這是少數工程組織能在生產環境中大規模執行此類系統的案例。目前,九成開發者每月使用AI編碼工具,相比半年前約一半的比例大幅提升。每位工程師的PR吞吐量增長超過50%。文中所有資料均來自monday.com內部生產資料。

本文將分享支撐這些數字的架構、在十年曆史程式碼庫中使其運作的改造措施,以及縮小與完全自主差距的置信評分合並策略。

monday.com的程式碼庫已有十年曆史,擁有數百萬付費使用者、數百個微前端和微服務以及數百名開發者。代理開放的每個PR都進入一個數百萬使用者期望在下一次部署中正常工作的系統。綠場演示直截了當,但在具有真實值班、客戶和合規性的企業SaaS中執行代理才是真正的挑戰。

AI工程可分為三個層級:L1助手層,工程師將AI作為結對程式設計夥伴;L2技能和子代理層,團隊構建可複用代理完成重複工作;L3多代理層,完全自主,代理端到端交付,工程師負責編排。目前monday.com大部分處於L2。

Sphera是monday.com的內部代理系統,其核心是一個團隊頁面,包含人類和代理的混合,每個代理都有個人資料、經理、範圍和績效評分。名為Atlas的代理是其中之一,角色為軟體工程師,任務包括領取工單、編寫PR和交付功能,與人類共享相同的待辦事項列表。代理擁有穩定身份,透過Slack、GitHub和monday.com流動,確保可標記、分配、程式碼審查或停用。

在架構層面,代理擁有三個第一類收件箱:Slack @提及、monday.com專案分配和GitHub PR審查請求,所有事件均路由到同一代理會話。系統使用了七個AWS服務:Amazon SNS、SQS、EKS、RDS、ElastiCache、EFS和S3,以及AWS Secrets Manager處理會話金鑰管理,Amazon Bedrock處理模型呼叫。事件路徑為:外部觸發器進入SNS,分發到按主題和路由鍵劃分的SQS佇列,然後由EKS上的消費者拉取並分配給適當的代理執行Pod。

monday-agent-sdk是Claude Agent SDK的輕量封裝,用於實現提供商中立、預編譯減少冷啟動,並允許自定義評估和整合。代理狀態分為三類:即時狀態儲存在ElastiCache中,會話和記憶體儲存在EFS上作為目錄,持久記錄儲存在S3中。Amazon Bedrock提供推理配置、審計追蹤、跨區域故障轉移和私有端點支援。計算叢集為EKS,每個活動會話對應一個Pod,自動縮放由KEDA基於平均活動會話完成。

文章還總結了五項關鍵改造:首先,在模型升級前進行確定性指標和LLM評估,確保代理效能提升;其次,將跨會話記憶儲存為Markdown檔案而非向量資料庫,避免上下文視窗溢位;第三,為每個會話提供遠端沙箱,在請求人類審查前自動部署PR並執行測試;第四,PR Guardrails將monday.com工程標準轉化為自動化審查,每月評估數萬PR,約五分之一被退回;第五,Builders CoWORK將代理任務放置在monday.com面板上,確保問責制。

截至2026年第一季度末,瓶頸已從程式碼生成轉向人類審查。為此,monday.com推出了首個完全自主工程代理Morphex,在相同倉庫、CI管道和協議下工作,19/20的PR自動合併,無需人工參與。其透過率是底線而非上限,關鍵問題在於找到提前判斷哪些PR可安全合併的訊號。資料顯示,約三成PR被合併,其中四分之三零人工編輯,且被拒絕的PR失敗原因與人類工程師相同,如測試不穩定、規範模糊等。