τ0-WM:最大規模預訓練的開源具身世界模型來了 – 量子位
τ0-WM:最大規模預訓練的開源具身世界模型來了
衡宇 2026-05-31 15:38:43
來源:量子位
17800小時的真機資料
henry 發自 凹非寺
量子位 | 公眾號 QbitAI
具身智慧火了快兩年,現在,終於有團隊富裕到拿真機資料去砸預訓練了。
而且一砸,就是17800小時。
這是啥概念?差不多相當於一臺機器人,連續兩年、一天24小時不停地被人類遙操作。
當所有人都以為真機資料是奢侈品,難以scaling,只能放在最後的微調階段時。
剛剛,上海創智學院副教授、智元機器人首席科學家羅劍嵐帶隊,釋出全球最大規模的開源預訓練具身世界模型——
τ0-World Model(τ0-WM)。
整個τ0-WM引數量達到5B,預訓練資料規模高達約3萬小時。其中,真機遙運算元據第一次成了絕對主力,佔到了1.78萬小時。
而3萬小時的預訓練資料,是目前全球開源預訓練具身世界模型中最大的。
τ0-WM不僅能像其他世界模型那樣預測未來畫面、生成動作。
更重要的是,它還結合了測試時計算(Test-Time Computation),讓機器人在執行前對多個候選動作進行排序,選出最優方案,質量不夠就呼叫模擬器修正後再執行。
基於這套方法;τ0-WM在四個長程精細操作任務,包括Toolbox(工具收納)、School Bag(書包裝物)、Badminton(羽毛球裝盒)和Faucet(水管接頭對接)的平均成功率超過了對標π0.5和Fast-WAM。
可以說,羅劍嵐團隊此前在後訓練方面的持續投入,不僅攢出了足夠規模的真機資料,也攢出了把這些資料用於大規模預訓練的經驗。
預訓練和後訓練這兩條線,終於對齊了。
提議、模擬、評估,然後行動
過去幾年,驅動機器人實現感知與控制的主流正規化,大多是一種反應式的端到端策略:
神經網路看到畫面,立刻輸出動作。
這種類似於人類“條件反射”的方式,在抓取、放置等標準任務裡已經非常成功。
但就像人類其實並不完全依賴肌肉記憶一樣,機器人在面對接觸密集、長程跨度、或者存在嚴重遮擋的複雜操作時,單純依靠“看見場景就輸出動作”的方式,也很容易導致不可逆的錯誤。
很多時候,一步錯,後面可能就全錯了。
所以,和許多世界模型方法一樣,τ0-WM選擇讓機器人在行動之前,先在腦子裡“想象”一下:
如果自己執行了這個動作,未來會發生什麼,環境會怎麼變化。
但τ0-WM特別的地方在於,它不只“想一次”。
為了讓機器人能夠三思而後行,研究引入了Test-Time Computation(測試時計算),讓機器人在真正執行前,可以多花一點時間,在內部“虛擬沙盤”裡並行想象很多次,反覆比較,甚至主動糾錯。
也就是說,τ0-WM讓機器人不再只是看到畫面就立刻出手,而是像人一樣,先在腦子裡盤一遍哪種路線更靠譜,再決定真正怎麼做。
某種程度上,這其實是在讓機器人學會一種“慢思考”。
具體來說,τ0-WM的線上推理,分成三步。
第一步,提議。
首先,影片動作模型(VAM)會根據當前多視角觀測、語言指令以及機器人狀態,一次性取樣出多組候選動作,同時生成對應的模糊未來畫面。
這相當於機器人先在腦子裡快速閃過幾種可能的做法。
第二步,推演。
其次,動作條件影片模擬器會針對每組候選動作,進一步生成對應的多視角未來畫面。
之所以是多視角,是因為真實機器人操作裡,正面視角經常會被機械臂或物體擋住,所以模型必須還能“腦補”側面、頂部等其他視角下的未來狀態,才能真正判斷動作後果。
第三步,評估與修正。
最後,系統會先用RCS(Re-denoising Consistency Score)給動作打分:把候選動作重新加噪,再丟回模型重新去噪,觀察重建誤差。
誤差越小,說明這個動作越接近模型訓練時學到的高質量動作分佈,也越靠譜。
但如果最優動作的分數依然不夠高,就會觸發第二層機制LAR(Low-quality Action Rectification)。
系統會把所有候選動作送進影片模擬器,預測對應未來狀態以及任務進度,挑出“任務推進效果最好”的未來畫面,再讓VAM基於這個“最優未來”重新生成動作。
最終,模型基於這三步走,輸出最好的動作。
值得一提的是,雖然很多世界模型在訓練時也會預測未來,但部署時為了推理速度,往往會把未來預測模組直接去掉。
τ0-WM則堅持在推理階段保留“顯式未來想象”,並把這些未來畫面真正用於後續動作的打分、篩選與修正。
也就是說,對τ0-WM而言,“想象未來”不是訓練技巧,而是機器人做決策的一部分。
在這三階段pipeline背後,τ0-WM主要由兩個共享影片擴散backbone元件驅動:
負責“提議動作”的VAM,以及負責“沙盤推演”的動作條件影片模擬器。
前者基於Wan2.2-5B影片生成模型,同時輸出未來影片latent和動作chunk;後者則專門負責評估未來狀態和任務進度。
而在訓練階段,三類不同來源的資料,也透過modality-specific supervision masks被統一揉進了同一個體系:
有動作標籤的資料,同時訓練影片與動作;沒有動作標籤的資料,則只訓練影片分支。
3萬小時預訓練資料
接下來,就到了τ0-WM這次最誇張、也最“重資產”的部分:訓練資料。
這近3萬小時的預訓練資料,不只重新整理了開源具身世界模型的規模紀錄,更重要的是,它正在打破行業對具身智慧資料金字塔的固有認知。
整個τ0-WM的訓練資料,主要由三部分組成,而且每一類資料的角色都不一樣。
第一類,是真機遙運算元據,總量17800小時。
這部分資料來自雙臂機器人、多視角採集,而且動作空間和真實部署環境完全對齊。
某種程度上,它也是整個資料體系裡“最貴”的部分。
因為真機採集不僅慢,還特別吃人力和硬體資源。但與此同時,它也是質量最高的資料。
這批資料提供了最核心的動作監督訊號,可以說是τ0-WM敢做大規模預訓練的真正根基。
第二類,是6500小時的UMI資料。
簡單來說,UMI(Universal Manipulation Interface)是一種不依賴特定機器人平臺的資料採集方式。
相比真機遙操作,它覆蓋的物體種類和操作場景會豐富很多。但問題也很明顯,它的動作空間,並不完全等同於真實機器人部署時的動作空間。
所以在τ0-WM中,UMI資料更像是在補“行為多樣性”。
它不一定最精準,但能讓模型見過更多操作方式、更多物體、更多長尾場景。
第三類,則是3000小時的人類第一視角EgoCentric資料。
這部分資料的採整合本最低,但覆蓋範圍卻最大。
裡面會包含大量長尾互動行為,以及很多機器人暫時很難專門採集到的真實場景。
不過,它有一個問題:沒有機器人動作標籤。
也就是說,模型只能“看”,不能直接學“機器人該怎麼動”。因此,這部分資料只參與影片分支訓練,不參與動作預測。
它更像是在幫助模型學習:物體會怎麼運動,人與環境會怎麼互動,場景狀態會如何變化。
看到這裡,其實會冒出一個很自然的問題:
既然人類影片沒有動作標籤,UMI的資料格式又和真機動作空間不完全一致,那模型到底怎麼把它們一起訓進去?
τ0-WM這裡用了一個很巧的設計——Modality-specific supervision masks(模態特定監督掩碼)。
簡單來說,對於有動作標籤的資料,就同時訓練影片和動作,沒有動作標籤的資料,就把動作部分mask掉,只訓練視覺分支。
這樣一來,不同來源、不同模態、不同動作空間的資料,就第一次被真正揉進了同一個預訓練體系裡。
實驗結論
在實驗部分,團隊最核心想驗證的一件事,其實就是:
Test-Time Computation(測試時計算),到底有沒有用。
在抽紙巾放進盒子和撿筆放進盒子兩個任務上,這兩個任務在3萬小時預訓練資料中從未出現過,屬於模型完全沒見過的新任務。
研究採用了比常規做法更嚴格的評測標準,不允許重試,單次機會,20輪取平均。
結果表明,不加測試時計算時,裸策略平均成功率只有43%。加入第一層RCS動作篩選後,提升到50%。
再疊加LAR模擬器修正之後,最終來到60%。提升最明顯的是更難的Pen→Box任務,成功率直接從30%拉到了50%。
此外,研究還專門對比了其他測試時引導方法。同樣條件下,Classifier-Free Guidance(CFG)成功率只有20%,Action Coherence Guidance(ACG)為38%,τ0-WM則達到60%。
這裡最關鍵的區別就來自之前提到的,CFG和ACG,本質上還是在檢查“動作本身是否連貫”。
而τ0-WM評估的,則是:
“這個動作做完之後,未來世界會變成什麼樣,任務有沒有真的往前推進。”
也就是說,前者關注的是動作空間內部的一致性。
而後者,開始真正把“未來後果”納入了決策。
(其餘實驗細節可參考論文)
資料金字塔,要變樣了
如果放到整個具身智慧行業的資料路線裡看,τ0-WM這次真正特別的地方,其實會更明顯。
過去,具身行業的資料體系一直像一個很典型的金字塔。
最底層,是網際網路影片資料。
規模最大、最便宜,但沒有機器人動作標籤,只能讓模型學一些通用視覺和世界變化規律。
再往上一層,是模擬資料。
機器人終於開始“動起來”了,但問題在於,模擬和真實物理世界之間,始終隔著一道巨大的sim2real gap。
而金字塔最頂層,則是真機遙運算元據。質量最高,動作空間和真實部署完全一致,但行業過去的普遍認知一直是:
太貴、太少、根本不可能scale。
所以大多數團隊,都會把真機資料留到最後微調階段再用。
但今年,一個新的變化開始出現了,Ego-Centric第一視角資料突然崛起。
大家開始意識到,人類第一視角影片雖然沒有機器人動作標籤,但它天然包含了大量真實世界裡的互動過程、物體變化和長尾操作。
於是整個行業,開始集體all in Ego資料。
某種程度上,Ego-Centric正在變成資料金字塔裡的“新中層”,比網際網路影片更接近真實互動,又比真機資料便宜得多。
但問題是,絕大多數團隊做到這裡,其實就停下來了,因為大家仍然預設真機資料依然貴到不可能成為預訓練主體。
但τ0-WM第一次把這個邏輯反過來了。
他們一邊引入Ego-Centric資料,一邊直接用17800小時真機遙運算元據給預訓練打底。
這件事也不是突然發生的。
回看羅劍嵐團隊過去一年多的工作,會發現一條非常清晰的主線,他們搭的不是單點模型,而是一整套真實世界資料飛輪。
2026年1月,SOP搭起了規模化的真機資料採集和迴流基礎設施。
2026年4月,LWD把大規模強化學習引入具身VLA的後訓練,構建了部署即訓練的資料飛輪,機器人跑得越多,迴流資料越多,模型越強,又能跑更多工。失敗軌跡也第一次被系統性納入學習。
而當真機互動資料積累跨過某個臨界點之後,一件以前沒人敢想的事,就自然發生了:
真機資料終於開始從“後訓練耗材”,變成“預訓練燃料”。
直到這裡,具身智慧裡的“預訓練—真機部署—資料迴流—再預訓練”這條鏈路,才第一次真正開始跑通。
專案網站:
https://finch.agibot.com/research/tau0-wm專案github:
https://github.com/sii-research/tau-0-wm模型huggingface:
https://huggingface.co/sii-research/tau-0-wm
版權所有,未經授權不得以任何形式轉載及使用,違者必究。
上海創智學院 具身智慧 資料
衡宇
1400億Agent入場,“流量”這條護城河要塌了2026-05-27
AI原生時代下,讓世界適應Agent,而非教AI做人 | 港大黃超@AIGC20262026-05-31
Qwen最新3.7 Max預覽版空降!兩代超大杯並行迭代,林俊暘走了但還在加速2026-05-19
龍蝦之父月燒940萬元的token!要不是入職OpenAI還真用不起2026-05-17
相關閱讀
華人博士4個月幹出具身獨角獸!斯坦福家務機器人再融11億,開建中國團隊
2026,不再只做demo
henry2026-03-13
具身智慧 機器人
當200位具身從業者被拉進同一個屋子
做具身彆著急“堆資料”,先想透這些問題
鄧思邈2026-04-28
具身智慧 螞蟻集團 量子位沙龍
地瓜機器人再獲1.5億美元投資!B輪累計融資2.7億美元
全面加速全球化業務佈局
量子位2026-04-08
具身智慧 地瓜機器人 融資
離開馬斯克後,他把人形機器人做成了這樣
集齊特斯拉/輝達/OpenAI班底,最新產品曝光
鄧思邈2026-01-10
人形機器人 具身智慧 特斯拉 矩陣超智
π0.7釋出,VLA押出了機器人的GPT-3時刻
π0.7:具有湧現能力的可控模型
henry2026-04-17
具身智慧
宇樹機器人被曝漏洞,機器人之間可相互感染,官方火速回應
雙足四足都中招了
衡宇2025-09-30
具身智慧 宇樹 機器人 機器狗
熱門文章
剛剛,國產AI自己造了AI,全球首例!
2026-05-26
卡帕西Anthropic最新頭銜:技術員工(MTS)
2026-05-26
7B打敗o3、GPT-5!醫學AI智慧體讓模型學會“看哪裡、怎麼看”
2026-05-28
面壁智慧「開源周」:一場定義端側 AI 終局的系統性「亮劍」
2026-05-29
DeepSeek V4芯模協同背後,國產算力生態開始飛輪加速
2026-05-28
掃碼關注量子位
量子位 QbitAI 版權所有©北京極客夥伴科技有限公司 京ICP備17005886號-1