Google DeepMind釋出三款實體AI模型,實現全身控制、靈巧操作與多機器人協作
Google DeepMind釋出了Gemini Robotics 2,這是其下一代機器人的智慧層。該版本包含三個模型:用於全身人形控制的視覺-語言-動作模型(VLA)、用於具身推理和任務編排的Gemini Robotics ER 2,以及可快速適應新機器人本體的裝置端VLA。一個檢查點可驅動Apptronik Apollo 2和Franka Duo。僅ER 2公開可用。
Google DeepMind釋出了Gemini Robotics 2,這是其下一代機器人的智慧層。此次釋出將機器人能力從桌面操作拓展到全身控制、五指靈巧操作和多機器人協作。該版本包含三個獨立的模型,並設定了三種不同的訪問層級。
當前大多數機器人都是預先程式設計或遠端操作的,僅能執行狹窄、重複的任務序列。它們無法適應不可預測的環境,技能也幾乎無法在不同機器人本體之間轉移。Gemini Robotics 2旨在同時解決這三個限制。
三款模型詳解
Gemini Robotics 2是視覺-語言-動作(VLA)模型。它將視覺和語言輸入轉換為電機控制訊號。它能夠驅動完整的人形機器人(從腳到指尖),以及其他雙臂機器人。它還能處理多指手和並行夾爪上的靈巧操作。
Gemini Robotics ER 2是具身推理(ER)模型。它是一個視覺語言模型,充當高層大腦。它能夠與人類溝通、理解物理世界,並規劃長達數分鐘的多步驟任務。根據其模型卡片,ER 2基於Gemini 3.5 Flash。它接受交錯的文本、影像、影片和音訊,上下文視窗高達128k,並輸出高達64K令牌的文本。
Gemini Robotics On-Device 2是高效的VLA模型,最佳化用於在機器人本地執行。其模型卡片顯示,它基於Gemini Robotics 1.5技術和Google的裝置端Gemma模型。輸入為文本、影像和機器人本體感知數值,輸出為機器人動作數值。
這種任務分工對系統設計至關重要。ER 2規劃並跟蹤任務,然後將電機執行交給宣告為工具的VLA。開發者將底層控制介面(如VLA模型或導航API)註冊為可呼叫工具,然後直接將多模態影片、音訊或文本流式輸入到模型中。
Apptronik Apollo 2上的全身控制
之前的Gemini Robotics模型僅控制人形機器人的上半身進行桌面任務。Gemini Robotics 2首次將控制擴充套件到全身運動。
示例中使用了Apptronik的Apollo 2。當給出指令“將水壺放入底層架子的綠色箱子中”時,Apollo會走到桌子旁拿起水壺,然後走幾步到架子前,將物體放到目的地。
Google DeepMind坦率地指出了剩餘的差距,稱其機器人在移動速度方面還有待提升。
跨手部和夾爪的靈巧操作
Gemini Robotics 2能夠控制Apollo 2上五根手指、22個自由度的SharpaWave手。報告的動作包括打結和密封拉鍊袋。同一模型還能在Franka Duo平臺上操作標準的二指平行夾爪,執行緊密包裝等任務。
報告的成功率來自一個模型檢查點控制三種本體:帶SharpaWave手的Apollo 2、帶Inspire手的Apollo 2,以及帶Robotiq夾爪的Franka Duo。
ER 2:時間智慧與工具編排
開發者X帖子關注一個很少被基準測試的問題:知道任務何時真正完成。進度分類:影片流中的每一幀被分配到五個進度級別之一(0-20%到80-100%)。Gemini Robotics ER 2在此任務上達到57.4%的準確率。Google DeepMind報告稱,這優於前代模型和競爭的前沿模型。時刻發現:衡量模型能否識別關鍵事件發生的精確幀。例如停止向咖啡杯倒水的時刻。ER 2達到91.3%的準確率,平均絕對距離為0.96秒。Google DeepMind報告稱,其與更大的模型類別競爭,執行速度是後者的4倍。工具編排:ER 2在三種控制模式(真實VLA、模擬VLA和人類遠端操作)下進行評估,均優於Gemini Robotics ER 1.6。
ER 2透過雙向流式端點與Gemini Live API整合。其目的消除中斷多步驟執行的停頓思考。它還可以原生呼叫工具,如Google搜尋或任何使用者定義的函式。
三種空間能力得到升級。成功與失敗檢測現在基於原始影片流而非靜態快照,從而捕獲執行過程中的溢位和滑動。通用儀表讀數從圓形刻度盤擴充套件到數字顯示器、線性刻度、尺子和液體溫度計,在10種儀表型別上進行了測試。空間視覺問答透過Gemini的多模態進步得到改進。
Google DeepMind與Boston Dynamics的Spot構建了一個演示,使用ER 2編排Spot的導航和操縱器API。示例程式碼可在robotics-samples倉庫中找到。
多機器人協作
Gemini Robotics 2引入了不同型別機器人之間的協作。理由是沒有任何單一機器人適合所有任務。輪式機器車適合室內工作,而人形機器人更適合不平坦地形。機器人透過共享語義理解來交接子任務。演示配對是Apptronik的Apollo 2與Franka F3 Duo。
On-Device 2:適應新機器人本體
Gemini Robotics On-Device 2針對無法依賴網路延遲或連線性的應用。它原生支援多本體,並繼承了Gemini Robotics 1.5的運動轉移技術。
Google DeepMind報告稱,適應新的雙夾爪本體僅需數小時,通常少於200個示例。這適用於形狀、感測器和自由度截然不同的本體。演示平臺包括Dexmate、SO101和Trossen。
模型卡片釋出了與On-Device 1在僅後訓練引入的平臺上的資料縮放比較:
SO101:On-Device 2從6.7%提升至53.3%,On-Device 1從0.0%提升至6.7%; Dexmate:On-Device 2從24.4%提升至75.6%,On-Device 1從13.3%提升至33.3%。
模型卡片還列出了限制:On-Device 2在泛化到分佈外任務以及控制高自由度機器人方面有限。
可用性
Gemini Robotics ER 2透過Gemini API和Google AI Studio公開預覽;Gemini Enterprise Agent Platform上提供私人預覽。 Gemini Robotics 2(VLA)面向早期訪問合作伙伴。 Gemini Robotics On-Device 2面向可信測試者。
AI Studio啟動連結使用模型字串gemini-robotics-er-2-preview。入門筆記本在robotics-samples倉庫中。
互動式直譯器
來源:Gemini Robotics 2公告、Gemini Robotics ER 2開發者文章、ER 2模型卡片、On-Device 2模型卡片、ASIMOV-Agentic資料集和安全技術報告。