使用低分辨率自我中心视觉的行为克隆实现主动感知
一项新研究表明,行为克隆可以在结构化物体寻找任务中产生主动感知能力,仅使用低分辨率自我中心视觉即可可靠完成任务。研究人员采用低成本机械臂和腕部RGB相机,通过预测相对关节增量而非绝对位置,显著提升了性能。
近日,一篇由Anthony Bilic等人提交至arXiv的论文(编号2605.14106)探索了行为克隆在主动感知任务中的应用。研究团队设计了一个结构化的物体寻找场景:一个配备腕部自我中心RGB相机的低成本机械臂,需要重新定位以将部分可见的植物居中,然后触发抓取信号。这一过程要求机器人采取能够改善未来观测的动作,即主动感知的核心——通过动作获取更好的感知信息。
模型采用行为克隆方法,直接从低分辨率RGB图像中预测关节指令,实现闭环控制。实验结果表明,低分辨率(例如32x32像素)的自我中心视觉足以可靠完成任务,这一发现挑战了高分辨率传感器为主动感知所必需的传统观点。更关键的是,研究显示预测相对关节增量(relative joint deltas)的方法在性能上大幅优于预测绝对关节位置。具体来说,相对增量预测使机器人能够更准确地调整末端执行器的位置,从而更有效地将目标物体居中。
这些结果证明,在可重复的环境中,基于视觉的主动感知可以从行为克隆中涌现。该研究为低成本机器人感知提供了新思路,表明无需高分辨率传感器或复杂模型即可实现有效的闭环交互。论文还讨论了该方法在工业分拣、家庭辅助等领域的潜在应用,以及未来在动态环境中验证的展望。