AI News HubLIVE
站内改写1 分钟阅读

状态中心决策过程

研究者提出状态中心决策过程(SDP),这是一种运行时框架,允许智能体通过承诺自然语言谓词,从原始文本环境中构建类似MDP的结构。SDP在五个基准测试上取得了最佳的无训练结果,并提供了认证轨迹以支持高级分析。

来源arXiv AI作者: Sungheon Jeong, Ryozo Masukawa, Sanggeon Yun, Mahdi Imani, Mohsen Imani

语言环境如网页浏览器、代码终端和交互式模拟通常只输出原始文本,而不提供马尔可夫决策过程(MDP)分析所需的运行时结构。这些环境没有明确的状态空间、观测到状态的映射、认证的转移规则或终止准则。这一缺失严重限制了智能体在复杂语言任务中的决策能力。来自多所机构的研究团队提出了一种名为“状态中心决策过程”(State-Centric Decision Process, SDP)的新型框架,旨在填补这一空白。

SDP的核心创新在于让智能体在行动过程中逐步构建缺失的MDP组件。具体而言,智能体在每一步都会承诺一个描述世界预期状态的自然语言谓词,然后执行一个动作使该谓词成立,并通过观测验证该谓词是否与实际情况一致。通过验证的谓词成为认证状态,整个轨迹最终包含了任务诱导的状态空间、观测到状态的映射、认证转移和终止准则。这种方法使得智能体能够在原本缺乏结构的语言环境中进行有效的决策。

研究者在五个涵盖不同领域的基准上对SDP进行了全面评估,包括规划、科学探索、网络推理和多跳问答。结果表明,SDP在所有基准上均取得了最佳的无训练结果,并且随着任务时序增长,其优势更加明显。例如,在处理需要多步推理的复杂任务时,SDP能够保持稳定的性能提升。此外,认证轨迹还支持多种传统反应式智能体无法实现的分析功能,如逐谓词信用分配、故障定位、部分进展测量以及模块化操作符替换。这些能力使得开发者能够更深入地理解智能体的决策过程,并针对性地进行优化。

该工作为语言环境中的智能决策提供了新的思路,展示了结构化表征在复杂任务中的重要性。未来,SDP有望被集成到各类语言交互系统中,提升自主智能体在现实场景中的可靠性。