AI News HubLIVE
站內改寫1 分鐘閱讀

信念校準優化:智能體優化的顯式世界模型

這篇論文提出信念校準優化(BCO),讓編碼式優化代理將隱性的環境信念寫為持續更新的上下文文檔,作為可複用的顯式世界模型。在記憶問答、工具使用問答、代碼型應用代理和終端代理等五組基準上,BCO較僅缺少該模塊的對照方法獲得更高訓練通過率;該優勢在未參與候選選擇的保留集上依然成立。後續換用不同基礎模型及離線內容消融進一步説明,收益源自文檔攜帶的信息內容。

來源arXiv AI作者: Yuhan Chen, Zhihua Tian, Mahavir Dabas, Charith Peris, Rahul Gupta, Ming Jin, Feiyang Kang, Siyuan Zhang, Nan Wang, Ruoxi Jia

一項日前提交至 arXiv 的新研究(編號 arXiv:2609.01861)提出“信念校準優化”(Belief-Calibrated Optimization, BCO),將編碼優化智能體對環境的隱性信念沉澱為持續更新的顯式文檔,從而使智能體腳手架(scaffold)的自動改進擁有一個真正可複用的“世界模型”。論文由 Yuhan Chen 等共 10 位作者撰寫,分類為 cs.AI。

大語言模型智能體的表現不僅取決於模型本身,也取決於外圍腳手架——即提示、工具調用與執行軌跡如何被組織。為改進腳手架,一種常見做法是讓編碼智能體充當優化器:讀取當前得分與軌跡,迭代編輯源碼,每輪產生新候選。每次編輯其實都隱含着一個判斷——環境為何出錯、何種修改會生效——但這一“信念”通常只存在於當次推理中或潛伏於模型參數裏,並未被寫下來,後續輪次也無從使用。

信念校準優化把這一隱性信念顯式化:在上下文中維護一份持續存在、隨新候選評估而不斷修訂的文檔。該文檔相當於智能體的世界模型,記錄着環境對編輯如何響應。論文作者將 BCO 加入原本標準的優化循環,與只缺少該世界模型的控制組對比,在記憶問答、工具使用問答、代碼即行動的應用智能體、終端智能體五項基準上取得更高訓練通過率。

在未參與候選選擇的保留集上,BCO 的優勢依舊存在,説明提升並非來自對候選的過擬合。研究者還更換了被優化的目標模型(保留原腳手架),BCO 選出的腳手架在多數測試任務上仍領先,僅少數因上下文窗口溢出而未能完成。離線消融則顯示,把積累的文檔交給一個新預測器,其預測環境響應的準確度高於“不帶文檔”或“攜帶內容被偽造的文檔”的預測器,證明收益來自文檔內容本身,而非文檔形式。

論文《Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization》於 2026 年 9 月 1 日提交至 arXiv,作者為 Yuhan Chen 等十位研究者。