AI News HubLIVE
站内改写1 分钟阅读

三思而后行:验证器引导的具身智能体动作选择

本文提出VeGAS框架,通过在推理时采样候选动作并利用生成式验证器选择最可靠动作,显著提升了基于多模态大模型的具身智能体在复杂环境中的鲁棒性和泛化能力,在Habitat和ALFRED基准上最高获得36%的相对性能提升。

来源arXiv AI作者: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

构建能够解决复杂现实任务的通用型具身智能体仍是人工智能领域的一项根本挑战。多模态大语言模型(MLLMs)凭借其强大的视觉-语言知识和思维链推理能力,显著提升了此类智能体的推理水平,但在面对困难的分布外场景时仍然脆弱。为了解决这一问题,研究者提出了验证器引导的动作选择框架(VeGAS),这是一种测试时框架,通过显式的验证步骤来提高基于MLLM的具身智能体的鲁棒性。在推理阶段,VeGAS并不直接执行单一解码动作,而是采样一组候选动作,并使用生成式验证器从中识别最可靠的选择,整个过程无需修改底层策略。关键在于,研究者发现直接使用现成的MLLM作为验证器并不能带来性能提升,这促使他们提出了一种基于LLM的数据合成策略:该策略自动构建一个多样化的失败案例课程,使验证器在训练时能够接触到丰富的潜在错误分布。在覆盖Habitat和ALFRED环境的具身推理基准测试中,VeGAS持续提升了泛化能力,在最具挑战性的多目标、长时任务上,相比强大的思维链基线方法,最高获得了36%的相对性能增益。该工作已被CVPR 2026接收为Findings论文。