將判斷力用在關鍵之處:我們如何構建AI原生的交付流程
本文探討了如何在AI工具普及的環境中保持人類判斷力,提出了一個結構化的交付管道,將人類注意力集中在關鍵決策上,而其餘部分由自動化的質量門控強制執行。作者基於在金融科技領域的實踐經驗,描述了從需求挑戰到實時驗證的完整流程,並討論了其成本與收益。
本文作者基於在金融科技領域一年的生產級AI應用構建經驗,提出了一個應對“認知債務”的解決方案。所謂認知債務,是指因過度依賴模型代替思考而導致的判斷力緩慢喪失。作者認為,解決之道並非減少工具使用或強迫保持警惕,而是建立一種結構化的交付管道,將人類判斷力集中在真正值得關注的思考和決策上,其餘部分由自動化的質量門控強制執行。
在傳統工程中,工程能力是約束條件,路線圖受限於團隊承載能力。而在智能體工具普及的今天,一個小團隊就能完成過去一個部門的工作量,但判斷力的供給並未增加。因此,工程領導者的核心工作轉變為決定人類注意力的投向,並構建保護和支持這種注意力的系統。
作者指出,不加控制地使用AI具有欺騙性:初期效果很好,產出豐富,速度提升,但潛在問題會隨着時間累積並突然爆發,表現為難以修復的代碼缺陷和團隊對代碼庫的陌生感。這種“認知債務”與技術債務最終合二為一,其成本被延遲,在不知不覺中增長,最終一次性償還。
為此,作者所在團隊運行着一個模擬交付團隊角色的管道,從工單到實現再到發佈變更,每個交接點都設有質量門控。流程從編寫工單開始,工單採用用户故事和驗收標準的形式,然後系統會自動挑戰其範圍,指出與現有系統的不一致,揭示空白並提出爭議性問題。與此同時,工程師完善工單和技術設計,任何診斷都遵循數據優先原則。
實現階段採用測試先行方法,在編寫一行生產代碼前就鎖定行為。實現完成後,一系列並行審查獨立進行:檢查變更是否符合驗收標準、項目架構和約定、API契約穩定性、安全性及供應鏈,最後還有一個簡化環節,用於去除不必要的複雜性。所有審查自動執行,無需人工記憶。
最後一步是實時驗證:一個智能體在真實環境中運行變更,驅動實際用户界面,檢查數據庫副作用和日誌,不僅測試正常路徑,也測試異常路徑。驗收標準在運行系統上得到驗證,超越了代碼測試層面。至此,一個豐富的拉取請求被創建,其合併受獨立智能體重新審查、持續集成通過和人工明確批准的約束。
“啓動”命令接受一個工單,從範圍挑戰到合併拉取請求,全程人類注意力僅集中在兩個節點:在開始前在產品與工程層面塑造工作,以及處理門控升級上來的爭議性決策。那些曾經耗費整個審查週期的微小實現細節,永遠不會到達人類面前。
這種方法通過雙重反轉避免了認知債務:首先,它將仍需人類完成的思考集中起來,每個人行使的判斷力都得到充分關注;其次,門控是結構性的而非可選的,質量和速度不再衝突。當質量檢查成為下一階段依賴的步驟而非需要記住的品質時,速度與安全並行不悖。系統還會記住團隊慣例,經驗教訓一次性記錄並生效,偏好成為護欄而非隱性知識。
這些門控並不減慢速度,它們消耗的是機器時間而非人類注意力,在人們處理下一項工作時並行運行。採用這種方式,三名工程師在六週內將一個新產品從概念推向公開發布,該平台每月處理數百萬金融事件,且不允許對客户出現任何錯誤數字。作者認為,以這樣的標準達到這樣的速度,對於這種規模的團隊而言,別無他法。
當然,這種模式也有成本:構建和調整管道需要時間,門控編碼了團隊的慣例和架構,代碼庫需要精心設計並由人員決定,管道需維護實時驗證環境。最大的未解問題是如何培養初級工程師的判斷力:在一個將他們從以往用於培養判斷力的繁瑣工作中屏蔽出來的系統內,他們如何成長?作者認為這是AI時代工程領導中最棘手的問題,需要集體解決。
最後,作者對工程領導者和其他工程師發出呼籲:採納智能體編程已不再是問題,工具無處不在,其影響不可否認。真正的分界線在於那些有控制地使用工具的團隊,與那些默默積累着隱藏在延遲中的債務而儀表盤依然光鮮的團隊。對於領導者,有效的路徑需要比熱情或謹慎更多的設計努力:決定哪些決策需要人類判斷,構建將那些決策路由給人類的結構,將其他所有質量屬性變為門控。結果是每個人以為是權衡的組合:更快的交付、更少的債務,以及因持續使用而變得更加敏鋭的判斷力。對於工程師,門控就是技能,是編碼團隊知識的文件,任何人都可以編寫和改進。一個值得明確界定的邊界是:這裏的一切都關於正確構建事物,而是否構建正確的事物則是另一門學科,沒有管道能為你回答。
隨着工具不斷進步,結構將決定它們讓團隊更有能力還是僅僅更多產。