Google DeepMind發佈三款實體AI模型,實現全身控制、靈巧操作與多機器人協作
Google DeepMind發佈了Gemini Robotics 2,這是其下一代機器人的智能層。該版本包含三個模型:用於全身人形控制的視覺-語言-動作模型(VLA)、用於具身推理和任務編排的Gemini Robotics ER 2,以及可快速適應新機器人本體的設備端VLA。一個檢查點可驅動Apptronik Apollo 2和Franka Duo。僅ER 2公開可用。
Google DeepMind發佈了Gemini Robotics 2,這是其下一代機器人的智能層。此次發佈將機器人能力從桌面操作拓展到全身控制、五指靈巧操作和多機器人協作。該版本包含三個獨立的模型,並設定了三種不同的訪問層級。
當前大多數機器人都是預先編程或遠程操作的,僅能執行狹窄、重複的任務序列。它們無法適應不可預測的環境,技能也幾乎無法在不同機器人本體之間轉移。Gemini Robotics 2旨在同時解決這三個限制。
三款模型詳解
Gemini Robotics 2是視覺-語言-動作(VLA)模型。它將視覺和語言輸入轉換為電機控制信號。它能夠驅動完整的人形機器人(從腳到指尖),以及其他雙臂機器人。它還能處理多指手和並行夾爪上的靈巧操作。
Gemini Robotics ER 2是具身推理(ER)模型。它是一個視覺語言模型,充當高層大腦。它能夠與人類溝通、理解物理世界,並規劃長達數分鐘的多步驟任務。根據其模型卡片,ER 2基於Gemini 3.5 Flash。它接受交錯的文本、圖像、視頻和音頻,上下文窗口高達128k,並輸出高達64K令牌的文本。
Gemini Robotics On-Device 2是高效的VLA模型,優化用於在機器人本地運行。其模型卡片顯示,它基於Gemini Robotics 1.5技術和Google的設備端Gemma模型。輸入為文本、圖像和機器人本體感知數值,輸出為機器人動作數值。
這種任務分工對系統設計至關重要。ER 2規劃並跟蹤任務,然後將電機執行交給聲明為工具的VLA。開發者將底層控制接口(如VLA模型或導航API)註冊為可調用工具,然後直接將多模態視頻、音頻或文本流式輸入到模型中。
Apptronik Apollo 2上的全身控制
之前的Gemini Robotics模型僅控制人形機器人的上半身進行桌面任務。Gemini Robotics 2首次將控制擴展到全身運動。
示例中使用了Apptronik的Apollo 2。當給出指令“將水壺放入底層架子的綠色箱子中”時,Apollo會走到桌子旁拿起水壺,然後走幾步到架子前,將物體放到目的地。
Google DeepMind坦率地指出了剩餘的差距,稱其機器人在移動速度方面還有待提升。
跨手部和夾爪的靈巧操作
Gemini Robotics 2能夠控制Apollo 2上五根手指、22個自由度的SharpaWave手。報告的動作包括打結和密封拉鍊袋。同一模型還能在Franka Duo平台上操作標準的二指平行夾爪,執行緊密包裝等任務。
報告的成功率來自一個模型檢查點控制三種本體:帶SharpaWave手的Apollo 2、帶Inspire手的Apollo 2,以及帶Robotiq夾爪的Franka Duo。
ER 2:時間智能與工具編排
開發者X帖子關注一個很少被基準測試的問題:知道任務何時真正完成。進度分類:視頻流中的每一幀被分配到五個進度級別之一(0-20%到80-100%)。Gemini Robotics ER 2在此任務上達到57.4%的準確率。Google DeepMind報告稱,這優於前代模型和競爭的前沿模型。時刻發現:衡量模型能否識別關鍵事件發生的精確幀。例如停止向咖啡杯倒水的時刻。ER 2達到91.3%的準確率,平均絕對距離為0.96秒。Google DeepMind報告稱,其與更大的模型類別競爭,執行速度是後者的4倍。工具編排:ER 2在三種控制模式(真實VLA、模擬VLA和人類遠程操作)下進行評估,均優於Gemini Robotics ER 1.6。
ER 2通過雙向流式端點與Gemini Live API集成。其目的消除中斷多步驟執行的停頓思考。它還可以原生調用工具,如Google搜索或任何用户定義的函數。
三種空間能力得到升級。成功與失敗檢測現在基於原始視頻流而非靜態快照,從而捕獲執行過程中的溢出和滑動。通用儀表讀數從圓形刻度盤擴展到數字顯示器、線性刻度、尺子和液體温度計,在10種儀表類型上進行了測試。空間視覺問答通過Gemini的多模態進步得到改進。
Google DeepMind與Boston Dynamics的Spot構建了一個演示,使用ER 2編排Spot的導航和操縱器API。示例代碼可在robotics-samples倉庫中找到。
多機器人協作
Gemini Robotics 2引入了不同類型機器人之間的協作。理由是沒有任何單一機器人適合所有任務。輪式機器車適合室內工作,而人形機器人更適合不平坦地形。機器人通過共享語義理解來交接子任務。演示配對是Apptronik的Apollo 2與Franka F3 Duo。
On-Device 2:適應新機器人本體
Gemini Robotics On-Device 2針對無法依賴網絡延遲或連接性的應用。它原生支持多本體,並繼承了Gemini Robotics 1.5的運動轉移技術。
Google DeepMind報告稱,適應新的雙夾爪本體僅需數小時,通常少於200個示例。這適用於形狀、傳感器和自由度截然不同的本體。演示平台包括Dexmate、SO101和Trossen。
模型卡片發佈了與On-Device 1在僅後訓練引入的平台上的數據縮放比較:
SO101:On-Device 2從6.7%提升至53.3%,On-Device 1從0.0%提升至6.7%; Dexmate:On-Device 2從24.4%提升至75.6%,On-Device 1從13.3%提升至33.3%。
模型卡片還列出了限制:On-Device 2在泛化到分佈外任務以及控制高自由度機器人方面有限。
可用性
Gemini Robotics ER 2通過Gemini API和Google AI Studio公開預覽;Gemini Enterprise Agent Platform上提供私人預覽。 Gemini Robotics 2(VLA)面向早期訪問合作伙伴。 Gemini Robotics On-Device 2面向可信測試者。
AI Studio啓動鏈接使用模型字符串gemini-robotics-er-2-preview。入門筆記本在robotics-samples倉庫中。
交互式解釋器
來源:Gemini Robotics 2公告、Gemini Robotics ER 2開發者文章、ER 2模型卡片、On-Device 2模型卡片、ASIMOV-Agentic數據集和安全技術報告。