AI News HubLIVE
站內改寫1 分鐘閱讀

WCM:面向通用人機互動的世界認知模型

研究人員提出世界認知模型(WCM),一種基於SLAK架構的人本具身智慧體,透過非同步執行時分離感知、推理、控制與記憶,並引入人類在環教學模式,使機器人能夠透過互動學習複雜任務。在九項真實世界人機互動任務中,WCM實現了73.8%的平均成功率,包括未參與思維鏈微調的任務和透過教學學習的長時域任務。

來源arXiv Robotics作者: Yuzhen Chen, KC Zhou

當前,語言智慧體(如ChatGPT)在軟體環境中已能與使用者進行流暢的互動,能夠理解複雜指令並生成相應響應。然而,當涉及物理任務時,機器人卻難以達到同樣的互動水平。現有的機器人控制正規化,包括視覺-語言-動作(VLA)策略和基於世界模型的規劃器,主要針對指令執行進行最佳化,導致使用者往往無法理解機器人為何選擇某個動作,也缺乏透過互動來引導、糾正或教導機器人的有效機制。

為了解決這一問題,研究人員提出了世界認知模型(World-Cognition Model, WCM),這是一種以人為中心的具身智慧體。WCM建立在SLAK架構(Sensing, Logic, Action, Knowledge)和非同步執行時之上。SLAK架構將感知、推理、控制和記憶模組進行分離,使得每個模組可以獨立最佳化和升級。非同步執行時則允許推理、對話和執行過程併發進行,從而提高了系統的整體效率和響應速度。

WCM的核心創新在於引入了人類在環(human-in-the-loop)教學模式。在這種模式下,使用者可以透過自然語言和示範動作,互動式地教導機器人完成困難或長時域的任務。教學過程中產生的互動片段以及機器人自主執行任務時的資料,會被提煉為思維鏈(chain-of-thought)監督訊號,用於持續改進模型。這種機制不僅提升了機器人的學習能力,還增強了人機互動的透明性和可解釋性。

在實驗評估中,WCM在九項真實世界的人機互動任務上實現了73.8%的平均成功率。這些任務包括未參與思維鏈微調的任務(held-out tasks)以及透過教學學習的長時域任務(long-horizon task)。值得注意的是,WCM在未經專門訓練的任務上也表現出良好的泛化能力,這得益於其模組化架構和持續學習機制。

WCM的提出為人機協作提供了更自然、高效的途徑。它使得使用者不再僅僅是指令的發出者,而是成為機器人的合作者和教導者。未來,WCM有望在家庭服務、醫療輔助、工業製造等領域發揮重要作用,推動機器人從工具向夥伴的轉變。