AI News HubLIVE
站內改寫1 分鐘閱讀

ANNEAL:透過受控符號補丁學習適應LLM代理

ANNEAL是一種神經符號代理,透過故障驅動知識獲取(FDKA)機制,在不修改基礎模型權重的情況下,將重複故障轉化為過程知識圖譜的受控符號編輯。在四個領域的測試中,ANNEAL將重複故障率降至0%,而基線方法如ReAct和Reflexion的故障率仍高達72-100%。

來源arXiv AI作者: Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

大型語言模型(LLM)代理在執行任務時能夠從單個錯誤中恢復,但當底層的過程知識——如運算子模式、前置條件和約束——未被修復時,它們會反覆在相同故障上失敗。現有自進化方法透過更新提示、記憶或模型權重來解決這一問題,但未能直接修復編碼任務執行方式的符號結構,且缺乏安全部署所需的治理保證。

為此,研究團隊提出了ANNEAL,一種神經符號代理,其核心是故障驅動知識獲取(FDKA)機制。FDKA首先定位導致重複故障的運算子,然後透過受限的LLM生成合成型別化補丁,並透過多維評分、符號護欄和金絲雀測試進行驗證,最後提交補丁。每個接受的編輯都帶有完整的來源和確定性回滾能力。

在四個領域(具體領域包括但不限於機器人任務規劃、Web導航、工具使用和資料庫查詢)和27次多種子執行中,ANNEAL是唯一能夠提交持久結構修復的系統。相比之下,強基線如ReAct和Reflexion雖然實現了高情境恢復率,但在重複故障上的保留故障率仍高達72-100%,而ANNEAL在測試的重複故障場景中將這一比例降至0%。消融實驗證實,移除FDKA後,所有結構修復消失,成功率下降高達26.7個百分點。

這些結果表明,受控符號修復為持久消除故障提供了一種補充正規化,與權重級和提示級適應方法相輔相成。ANNEAL的程式碼實現已在GitHub上開源,研究論文提交於2026年5月4日,並已被arXiv收錄(ID: 2605.16309)。該工作為構建更可靠、可治理的LLM代理系統開闢了新的方向,尤其適用於需要長期自主執行且故障代價高昂的生產環境。