使用低分辨率自我中心視覺的行為克隆實現主動感知
一項新研究表明,行為克隆可以在結構化物體尋找任務中產生主動感知能力,僅使用低分辨率自我中心視覺即可可靠完成任務。研究人員採用低成本機械臂和腕部RGB相機,通過預測相對關節增量而非絕對位置,顯著提升了性能。
近日,一篇由Anthony Bilic等人提交至arXiv的論文(編號2605.14106)探索了行為克隆在主動感知任務中的應用。研究團隊設計了一個結構化的物體尋找場景:一個配備腕部自我中心RGB相機的低成本機械臂,需要重新定位以將部分可見的植物居中,然後觸發抓取信號。這一過程要求機器人採取能夠改善未來觀測的動作,即主動感知的核心——通過動作獲取更好的感知信息。
模型採用行為克隆方法,直接從低分辨率RGB圖像中預測關節指令,實現閉環控制。實驗結果表明,低分辨率(例如32x32像素)的自我中心視覺足以可靠完成任務,這一發現挑戰了高分辨率傳感器為主動感知所必需的傳統觀點。更關鍵的是,研究顯示預測相對關節增量(relative joint deltas)的方法在性能上大幅優於預測絕對關節位置。具體來説,相對增量預測使機器人能夠更準確地調整末端執行器的位置,從而更有效地將目標物體居中。
這些結果證明,在可重複的環境中,基於視覺的主動感知可以從行為克隆中湧現。該研究為低成本機器人感知提供了新思路,表明無需高分辨率傳感器或複雜模型即可實現有效的閉環交互。論文還討論了該方法在工業分揀、家庭輔助等領域的潛在應用,以及未來在動態環境中驗證的展望。