信念校准优化:智能体优化的显式世界模型
这篇论文提出信念校准优化(BCO),让编码式优化代理将隐性的环境信念写为持续更新的上下文文档,作为可复用的显式世界模型。在记忆问答、工具使用问答、代码型应用代理和终端代理等五组基准上,BCO较仅缺少该模块的对照方法获得更高训练通过率;该优势在未参与候选选择的保留集上依然成立。后续换用不同基础模型及离线内容消融进一步说明,收益源自文档携带的信息内容。
一项日前提交至 arXiv 的新研究(编号 arXiv:2609.01861)提出“信念校准优化”(Belief-Calibrated Optimization, BCO),将编码优化智能体对环境的隐性信念沉淀为持续更新的显式文档,从而使智能体脚手架(scaffold)的自动改进拥有一个真正可复用的“世界模型”。论文由 Yuhan Chen 等共 10 位作者撰写,分类为 cs.AI。
大语言模型智能体的表现不仅取决于模型本身,也取决于外围脚手架——即提示、工具调用与执行轨迹如何被组织。为改进脚手架,一种常见做法是让编码智能体充当优化器:读取当前得分与轨迹,迭代编辑源码,每轮产生新候选。每次编辑其实都隐含着一个判断——环境为何出错、何种修改会生效——但这一“信念”通常只存在于当次推理中或潜伏于模型参数里,并未被写下来,后续轮次也无从使用。
信念校准优化把这一隐性信念显式化:在上下文中维护一份持续存在、随新候选评估而不断修订的文档。该文档相当于智能体的世界模型,记录着环境对编辑如何响应。论文作者将 BCO 加入原本标准的优化循环,与只缺少该世界模型的控制组对比,在记忆问答、工具使用问答、代码即行动的应用智能体、终端智能体五项基准上取得更高训练通过率。
在未参与候选选择的保留集上,BCO 的优势依旧存在,说明提升并非来自对候选的过拟合。研究者还更换了被优化的目标模型(保留原脚手架),BCO 选出的脚手架在多数测试任务上仍领先,仅少数因上下文窗口溢出而未能完成。离线消融则显示,把积累的文档交给一个新预测器,其预测环境响应的准确度高于“不带文档”或“携带内容被伪造的文档”的预测器,证明收益来自文档内容本身,而非文档形式。
论文《Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization》于 2026 年 9 月 1 日提交至 arXiv,作者为 Yuhan Chen 等十位研究者。