企業AI投資回報率的瓶頸在於反饋循環
本文指出,企業AI投資回報率的主要瓶頸是用於改進專業智能體的反饋循環。目前團隊使用即興流程(如電子表格和工單)進行改進,效率低下。作者介紹了Kinesthetic,一種無需權重更新即可將專家修正轉化為智能體行為的解決方案,從而形成閉環。
在構建生產級專業智能體的團隊中,我們不斷發現相同的流程:來自可觀測性平台的跟蹤數據被導出到電子表格,由領域專家註釋,然後轉換為Linear問題或Jira工單,最終由未參與任何相關對話的工程師進行幾乎未經測試的提示編輯。這條流水線是目前大多數垂直AI智能體改進的實際發生方式——它複製了適用於軟件開發的即興流程,但在處理機器學習模型時並不適用。
AI並非炒作。編碼智能體(如Claude Code、Codex、Cursor)已經證明了它們的工作價值。然而,在審計、法律、金融等白領工作中,情況截然不同。這些領域沒有現成的開放測試套件或基準。正確性取決於主觀判斷和專業判斷,而非邏輯執行和觀察。因此,一個關鍵問題浮現:在無法驗證獎勵的領域,訓練信號從何而來?
大多數團隊的回答是:來自人。儘管智能體評判已成為標準,但可靠的真實來源仍然是審查智能體工作並註釋錯誤及原因的專家(通常是內部人員)。在這些不可驗證的垂直領域,領域專家就是梯度。
因此,修正循環成為整個問題的核心。如果專家的註釋是學習信號(梯度),那麼從導出到改進智能體的路徑就是學習率。當前,這條路徑是一場從領域專家到產品經理再到工程師的傳話遊戲,產生有損修正,往往導致不穩定或不完整的改進,迫使新一輪註釋、分類和開發。
我們與數十個構建智能體的團隊交流,意識到運營效率低下是結構性的,而非文化性的。工程師不希望產品經理更新提示,因為他們不瞭解提示或知識如何在系統中檢索和使用;產品經理希望與領域專家確認工程師做出的看起來不合理的任意決策;領域專家產生了大量反饋,而工程團隊根本不知道如何優先處理。修正被導出到電子表格,重新編碼為工單,在三個需要落地的位置中只實現了其中一個,兩週後發佈,且未檢查是否真正改變了預期行為。
反饋循環沒有閉環,也沒有基礎設施來關閉它。現有的工具(如智能體SDK和可觀測性平台)只能幫助快速啓動智能體或查看跟蹤,但查看跟蹤並非難點。難點在於教導智能體,而目前沒有基礎設施擁有從專家修正到驗證行為變更的完整路徑。
我們認為,解決之道不在於讓領域專家更懂技術或讓工程師更懂領域,這兩者都是上下文切換的負擔。領域專家應該能夠直接用其領域語言教導智能體,而工程師則應擁有將修正轉化為行為的系統。通過評估而非記憶來關閉循環。
研究方面,後訓練似乎是明顯的答案,但對大多數團隊而言並非正確的第一步。構建強化學習環境、滿足數據需求、承擔訓練成本以及處理治理問題都是挑戰。即便解決了這些,持續學習問題仍未解決。權重空間方法仍需應對熵崩潰和災難性遺忘,近期研究還暴露了知識保留、藴含差距等更細微的失敗。同樣,在令牌空間(上下文學習)中,提示學習存在過擬合和退化問題。
我們認為解決方案存在於兩者之間。Kinesthetic正在構建一個無需權重更新即可將專家修正轉化為智能體行為的層。具體來説,我們獲取已解決和修正的軌跡,將其包含的通用程序性指導(元梯度)提煉為令牌空間,並在測試時檢索,從而使改進成為領域專家可閲讀、可爭論、可批准的文本工件,工程師可對其進行版本控制和評估。我們已在Harvey LAB和Sierra τ³-Banking基準上展示了顯著改進。
我們的解決方案有兩個不可妥協的特性:每項改進都可讀可解釋,你可以指出改變行為的工件;循環在數據所在的地方運行,軌跡和修正無需離開合作伙伴的環境。我們相信,教導智能體最終應像 onboarding 新員工一樣:展示工作,糾正判斷,智能體逐漸進步。我們離這個目標還有很長的路,但我們認為差距不會通過等待下一個模型而縮小。