AI News HubLIVE
站内改写3 分钟阅读

Google DeepMind发布三款实体AI模型,实现全身控制、灵巧操作与多机器人协作

Google DeepMind发布了Gemini Robotics 2,这是其下一代机器人的智能层。该版本包含三个模型:用于全身人形控制的视觉-语言-动作模型(VLA)、用于具身推理和任务编排的Gemini Robotics ER 2,以及可快速适应新机器人本体的设备端VLA。一个检查点可驱动Apptronik Apollo 2和Franka Duo。仅ER 2公开可用。

来源MarkTechPost作者: Asif Razzaq

Google DeepMind发布了Gemini Robotics 2,这是其下一代机器人的智能层。此次发布将机器人能力从桌面操作拓展到全身控制、五指灵巧操作和多机器人协作。该版本包含三个独立的模型,并设定了三种不同的访问层级。

当前大多数机器人都是预先编程或远程操作的,仅能执行狭窄、重复的任务序列。它们无法适应不可预测的环境,技能也几乎无法在不同机器人本体之间转移。Gemini Robotics 2旨在同时解决这三个限制。

三款模型详解

Gemini Robotics 2是视觉-语言-动作(VLA)模型。它将视觉和语言输入转换为电机控制信号。它能够驱动完整的人形机器人(从脚到指尖),以及其他双臂机器人。它还能处理多指手和并行夹爪上的灵巧操作。

Gemini Robotics ER 2是具身推理(ER)模型。它是一个视觉语言模型,充当高层大脑。它能够与人类沟通、理解物理世界,并规划长达数分钟的多步骤任务。根据其模型卡片,ER 2基于Gemini 3.5 Flash。它接受交错的文本、图像、视频和音频,上下文窗口高达128k,并输出高达64K令牌的文本。

Gemini Robotics On-Device 2是高效的VLA模型,优化用于在机器人本地运行。其模型卡片显示,它基于Gemini Robotics 1.5技术和Google的设备端Gemma模型。输入为文本、图像和机器人本体感知数值,输出为机器人动作数值。

这种任务分工对系统设计至关重要。ER 2规划并跟踪任务,然后将电机执行交给声明为工具的VLA。开发者将底层控制接口(如VLA模型或导航API)注册为可调用工具,然后直接将多模态视频、音频或文本流式输入到模型中。

Apptronik Apollo 2上的全身控制

之前的Gemini Robotics模型仅控制人形机器人的上半身进行桌面任务。Gemini Robotics 2首次将控制扩展到全身运动。

示例中使用了Apptronik的Apollo 2。当给出指令“将水壶放入底层架子的绿色箱子中”时,Apollo会走到桌子旁拿起水壶,然后走几步到架子前,将物体放到目的地。

Google DeepMind坦率地指出了剩余的差距,称其机器人在移动速度方面还有待提升。

跨手部和夹爪的灵巧操作

Gemini Robotics 2能够控制Apollo 2上五根手指、22个自由度的SharpaWave手。报告的动作包括打结和密封拉链袋。同一模型还能在Franka Duo平台上操作标准的二指平行夹爪,执行紧密包装等任务。

报告的成功率来自一个模型检查点控制三种本体:带SharpaWave手的Apollo 2、带Inspire手的Apollo 2,以及带Robotiq夹爪的Franka Duo。

ER 2:时间智能与工具编排

开发者X帖子关注一个很少被基准测试的问题:知道任务何时真正完成。进度分类:视频流中的每一帧被分配到五个进度级别之一(0-20%到80-100%)。Gemini Robotics ER 2在此任务上达到57.4%的准确率。Google DeepMind报告称,这优于前代模型和竞争的前沿模型。时刻发现:衡量模型能否识别关键事件发生的精确帧。例如停止向咖啡杯倒水的时刻。ER 2达到91.3%的准确率,平均绝对距离为0.96秒。Google DeepMind报告称,其与更大的模型类别竞争,执行速度是后者的4倍。工具编排:ER 2在三种控制模式(真实VLA、模拟VLA和人类远程操作)下进行评估,均优于Gemini Robotics ER 1.6。

ER 2通过双向流式端点与Gemini Live API集成。其目的消除中断多步骤执行的停顿思考。它还可以原生调用工具,如Google搜索或任何用户定义的函数。

三种空间能力得到升级。成功与失败检测现在基于原始视频流而非静态快照,从而捕获执行过程中的溢出和滑动。通用仪表读数从圆形刻度盘扩展到数字显示器、线性刻度、尺子和液体温度计,在10种仪表类型上进行了测试。空间视觉问答通过Gemini的多模态进步得到改进。

Google DeepMind与Boston Dynamics的Spot构建了一个演示,使用ER 2编排Spot的导航和操纵器API。示例代码可在robotics-samples仓库中找到。

多机器人协作

Gemini Robotics 2引入了不同类型机器人之间的协作。理由是没有任何单一机器人适合所有任务。轮式机器车适合室内工作,而人形机器人更适合不平坦地形。机器人通过共享语义理解来交接子任务。演示配对是Apptronik的Apollo 2与Franka F3 Duo。

On-Device 2:适应新机器人本体

Gemini Robotics On-Device 2针对无法依赖网络延迟或连接性的应用。它原生支持多本体,并继承了Gemini Robotics 1.5的运动转移技术。

Google DeepMind报告称,适应新的双夹爪本体仅需数小时,通常少于200个示例。这适用于形状、传感器和自由度截然不同的本体。演示平台包括Dexmate、SO101和Trossen。

模型卡片发布了与On-Device 1在仅后训练引入的平台上的数据缩放比较:

SO101:On-Device 2从6.7%提升至53.3%,On-Device 1从0.0%提升至6.7%; Dexmate:On-Device 2从24.4%提升至75.6%,On-Device 1从13.3%提升至33.3%。

模型卡片还列出了限制:On-Device 2在泛化到分布外任务以及控制高自由度机器人方面有限。

可用性

Gemini Robotics ER 2通过Gemini API和Google AI Studio公开预览;Gemini Enterprise Agent Platform上提供私人预览。 Gemini Robotics 2(VLA)面向早期访问合作伙伴。 Gemini Robotics On-Device 2面向可信测试者。

AI Studio启动链接使用模型字符串gemini-robotics-er-2-preview。入门笔记本在robotics-samples仓库中。

交互式解释器

来源:Gemini Robotics 2公告、Gemini Robotics ER 2开发者文章、ER 2模型卡片、On-Device 2模型卡片、ASIMOV-Agentic数据集和安全技术报告。