Google DeepMind新AI模型可控制机器人全身
Google DeepMind发布Gemini Robotics 2,将控制范围从上半身扩展至全身运动,包括行走、蹲下、伸展等,并支持五指手进行精细操作,如密封拉链袋、拧灯泡等。同时升级了具身推理模型ER 2,提升了长时间任务完成能力和安全性,支持多机器人协作,并改进了设备端模型。
Google DeepMind于周四宣布,其最新版Gemini Robotics AI模型“能够控制完整的人形机器人”。与先前仅控制上半身的版本不同,Gemini Robotics 2现在支持从脚趾到指尖的“全身运动”,使机器人能够执行更广泛的动作。
新模型允许人形机器人行走、蹲下、伸展并操纵物体。Google分享的视频显示,Apptronik的Apollo 2机器人可以弯腰捡起喷壶,还能从架子上找到并取下特定物品。尽管DeepMind指出机器人在“运动速度上仍有待提升”,但这次更新是“朝着完成需要全身协调的复杂现实任务迈出的重要一步”。
Gemini Robotics 2还提高了灵巧性,现在能控制更复杂的五指手,从而执行诸如密封拉链袋、系垃圾袋或拧灯泡等任务。这些能力的提升使得机器人能够应对更多日常操作场景。
与此同时,DeepMind还升级了Gemini Robotics ER(具身推理)视觉语言模型,帮助机器人分析环境、处理指令并执行多步骤任务。新版ER 2在长时间任务上表现更佳,并“理解任务的开始和结束”。该更新还允许多个不同类型的机器人协同工作,例如Apollo 2在清理车库时指挥双臂机器人将工具放入垃圾箱。
在安全方面,DeepMind称Gemini Robotics ER 2是“迄今为止最安全的机器人模型”。它能够更好地检测人类靠近,触发安全工具调用,并在有人过于接近时使机器人安全停止。此外,改进后的Gemini Robotics On-Device Model可在无网络连接的情况下本地运行,并更快适应不同外形、传感器和自由度的机器人。