信念校準最佳化:智慧體最佳化的顯式世界模型
這篇論文提出信念校準最佳化(BCO),讓編碼式最佳化代理將隱性的環境信念寫為持續更新的上下文文件,作為可複用的顯式世界模型。在記憶問答、工具使用問答、程式碼型應用代理和終端代理等五組基準上,BCO較僅缺少該模組的對照方法獲得更高訓練透過率;該優勢在未參與候選選擇的保留集上依然成立。後續換用不同基礎模型及離線內容消融進一步說明,收益源自文件攜帶的資訊內容。
一項日前提交至 arXiv 的新研究(編號 arXiv:2609.01861)提出“信念校準最佳化”(Belief-Calibrated Optimization, BCO),將編碼最佳化智慧體對環境的隱性信念沉澱為持續更新的顯式文件,從而使智慧體腳手架(scaffold)的自動改進擁有一個真正可複用的“世界模型”。論文由 Yuhan Chen 等共 10 位作者撰寫,分類為 cs.AI。
大語言模型智慧體的表現不僅取決於模型本身,也取決於外圍腳手架——即提示、工具呼叫與執行軌跡如何被組織。為改進腳手架,一種常見做法是讓編碼智慧體充當最佳化器:讀取當前得分與軌跡,迭代編輯原始碼,每輪產生新候選。每次編輯其實都隱含著一個判斷——環境為何出錯、何種修改會生效——但這一“信念”通常只存在於當次推理中或潛伏於模型引數裡,並未被寫下來,後續輪次也無從使用。
信念校準最佳化把這一隱性信念顯式化:在上下文中維護一份持續存在、隨新候選評估而不斷修訂的文件。該文件相當於智慧體的世界模型,記錄著環境對編輯如何響應。論文作者將 BCO 加入原本標準的最佳化迴圈,與只缺少該世界模型的控制組對比,在記憶問答、工具使用問答、程式碼即行動的應用智慧體、終端智慧體五項基準上取得更高訓練透過率。
在未參與候選選擇的保留集上,BCO 的優勢依舊存在,說明提升並非來自對候選的過擬合。研究者還更換了被最佳化的目標模型(保留原腳手架),BCO 選出的腳手架在多數測試任務上仍領先,僅少數因上下文視窗溢位而未能完成。離線消融則顯示,把積累的文件交給一個新預測器,其預測環境響應的準確度高於“不帶文件”或“攜帶內容被偽造的文件”的預測器,證明收益來自文件內容本身,而非文件形式。
論文《Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization》於 2026 年 9 月 1 日提交至 arXiv,作者為 Yuhan Chen 等十位研究者。