三思而後行:驗證器引導的具身智能體動作選擇
本文提出VeGAS框架,通過在推理時採樣候選動作並利用生成式驗證器選擇最可靠動作,顯著提升了基於多模態大模型的具身智能體在複雜環境中的魯棒性和泛化能力,在Habitat和ALFRED基準上最高獲得36%的相對性能提升。
來源arXiv AI作者: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach
構建能夠解決複雜現實任務的通用型具身智能體仍是人工智能領域的一項根本挑戰。多模態大語言模型(MLLMs)憑藉其強大的視覺-語言知識和思維鏈推理能力,顯著提升了此類智能體的推理水平,但在面對困難的分佈外場景時仍然脆弱。為了解決這一問題,研究者提出了驗證器引導的動作選擇框架(VeGAS),這是一種測試時框架,通過顯式的驗證步驟來提高基於MLLM的具身智能體的魯棒性。在推理階段,VeGAS並不直接執行單一解碼動作,而是採樣一組候選動作,並使用生成式驗證器從中識別最可靠的選擇,整個過程無需修改底層策略。關鍵在於,研究者發現直接使用現成的MLLM作為驗證器並不能帶來性能提升,這促使他們提出了一種基於LLM的數據合成策略:該策略自動構建一個多樣化的失敗案例課程,使驗證器在訓練時能夠接觸到豐富的潛在錯誤分佈。在覆蓋Habitat和ALFRED環境的具身推理基準測試中,VeGAS持續提升了泛化能力,在最具挑戰性的多目標、長時任務上,相比強大的思維鏈基線方法,最高獲得了36%的相對性能增益。該工作已被CVPR 2026接收為Findings論文。