跳到主要內容
AI News HubLIVE
站內改寫7 分鐘閱讀

τ0-WM:最大規模預訓練的開源具身世界模型來了

文章摘要

最大規模開源預訓練具身世界模型τ0-WM釋出,引數量5B,預訓練資料達3萬小時,其中真機遙運算元據1.78萬小時。模型結合測試時計算,讓機器人在執行前多步推演並排序動作,顯著提升長程精細操作成功率。

來源量子位作者: 衡宇
τ0-WM:最大規模預訓練的開源具身世界模型來了
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

τ0-WM:最大規模預訓練的開源具身世界模型來了 – 量子位

τ0-WM:最大規模預訓練的開源具身世界模型來了

衡宇 2026-05-31 15:38:43

來源:量子位

17800小時的真機資料

henry 發自 凹非寺

量子位 | 公眾號 QbitAI

具身智慧火了快兩年,現在,終於有團隊富裕到拿真機資料去砸預訓練了。

而且一砸,就是17800小時。

這是啥概念?差不多相當於一臺機器人,連續兩年、一天24小時不停地被人類遙操作。

當所有人都以為真機資料是奢侈品,難以scaling,只能放在最後的微調階段時。

剛剛,上海創智學院副教授、智元機器人首席科學家羅劍嵐帶隊,釋出全球最大規模的開源預訓練具身世界模型——

τ0-World Model(τ0-WM)。

整個τ0-WM引數量達到5B,預訓練資料規模高達約3萬小時。其中,真機遙運算元據第一次成了絕對主力,佔到了1.78萬小時。

而3萬小時的預訓練資料,是目前全球開源預訓練具身世界模型中最大的。

τ0-WM不僅能像其他世界模型那樣預測未來畫面、生成動作。

更重要的是,它還結合了測試時計算(Test-Time Computation),讓機器人在執行前對多個候選動作進行排序,選出最優方案,質量不夠就呼叫模擬器修正後再執行。

基於這套方法;τ0-WM在四個長程精細操作任務,包括Toolbox(工具收納)、School Bag(書包裝物)、Badminton(羽毛球裝盒)和Faucet(水管接頭對接)的平均成功率超過了對標π0.5和Fast-WAM。

可以說,羅劍嵐團隊此前在後訓練方面的持續投入,不僅攢出了足夠規模的真機資料,也攢出了把這些資料用於大規模預訓練的經驗。

預訓練和後訓練這兩條線,終於對齊了。

提議、模擬、評估,然後行動

過去幾年,驅動機器人實現感知與控制的主流正規化,大多是一種反應式的端到端策略:

神經網路看到畫面,立刻輸出動作。

這種類似於人類“條件反射”的方式,在抓取、放置等標準任務裡已經非常成功。

但就像人類其實並不完全依賴肌肉記憶一樣,機器人在面對接觸密集、長程跨度、或者存在嚴重遮擋的複雜操作時,單純依靠“看見場景就輸出動作”的方式,也很容易導致不可逆的錯誤。

很多時候,一步錯,後面可能就全錯了。

所以,和許多世界模型方法一樣,τ0-WM選擇讓機器人在行動之前,先在腦子裡“想象”一下:

如果自己執行了這個動作,未來會發生什麼,環境會怎麼變化。

但τ0-WM特別的地方在於,它不只“想一次”。

為了讓機器人能夠三思而後行,研究引入了Test-Time Computation(測試時計算),讓機器人在真正執行前,可以多花一點時間,在內部“虛擬沙盤”裡並行想象很多次,反覆比較,甚至主動糾錯。

也就是說,τ0-WM讓機器人不再只是看到畫面就立刻出手,而是像人一樣,先在腦子裡盤一遍哪種路線更靠譜,再決定真正怎麼做。

某種程度上,這其實是在讓機器人學會一種“慢思考”。

具體來說,τ0-WM的線上推理,分成三步。

第一步,提議。

首先,影片動作模型(VAM)會根據當前多視角觀測、語言指令以及機器人狀態,一次性取樣出多組候選動作,同時生成對應的模糊未來畫面。

這相當於機器人先在腦子裡快速閃過幾種可能的做法。

第二步,推演。

其次,動作條件影片模擬器會針對每組候選動作,進一步生成對應的多視角未來畫面。

之所以是多視角,是因為真實機器人操作裡,正面視角經常會被機械臂或物體擋住,所以模型必須還能“腦補”側面、頂部等其他視角下的未來狀態,才能真正判斷動作後果。

第三步,評估與修正。

最後,系統會先用RCS(Re-denoising Consistency Score)給動作打分:把候選動作重新加噪,再丟回模型重新去噪,觀察重建誤差。

誤差越小,說明這個動作越接近模型訓練時學到的高質量動作分佈,也越靠譜。

但如果最優動作的分數依然不夠高,就會觸發第二層機制LAR(Low-quality Action Rectification)。

系統會把所有候選動作送進影片模擬器,預測對應未來狀態以及任務進度,挑出“任務推進效果最好”的未來畫面,再讓VAM基於這個“最優未來”重新生成動作。

最終,模型基於這三步走,輸出最好的動作。

值得一提的是,雖然很多世界模型在訓練時也會預測未來,但部署時為了推理速度,往往會把未來預測模組直接去掉。

τ0-WM則堅持在推理階段保留“顯式未來想象”,並把這些未來畫面真正用於後續動作的打分、篩選與修正。

也就是說,對τ0-WM而言,“想象未來”不是訓練技巧,而是機器人做決策的一部分。

在這三階段pipeline背後,τ0-WM主要由兩個共享影片擴散backbone元件驅動:

負責“提議動作”的VAM,以及負責“沙盤推演”的動作條件影片模擬器。

前者基於Wan2.2-5B影片生成模型,同時輸出未來影片latent和動作chunk;後者則專門負責評估未來狀態和任務進度。

而在訓練階段,三類不同來源的資料,也透過modality-specific supervision masks被統一揉進了同一個體系:

有動作標籤的資料,同時訓練影片與動作;沒有動作標籤的資料,則只訓練影片分支。

3萬小時預訓練資料

接下來,就到了τ0-WM這次最誇張、也最“重資產”的部分:訓練資料。

這近3萬小時的預訓練資料,不只重新整理了開源具身世界模型的規模紀錄,更重要的是,它正在打破行業對具身智慧資料金字塔的固有認知。

整個τ0-WM的訓練資料,主要由三部分組成,而且每一類資料的角色都不一樣。

第一類,是真機遙運算元據,總量17800小時。

這部分資料來自雙臂機器人、多視角採集,而且動作空間和真實部署環境完全對齊。

某種程度上,它也是整個資料體系裡“最貴”的部分。

因為真機採集不僅慢,還特別吃人力和硬體資源。但與此同時,它也是質量最高的資料。

這批資料提供了最核心的動作監督訊號,可以說是τ0-WM敢做大規模預訓練的真正根基。

第二類,是6500小時的UMI資料。

簡單來說,UMI(Universal Manipulation Interface)是一種不依賴特定機器人平臺的資料採集方式。

相比真機遙操作,它覆蓋的物體種類和操作場景會豐富很多。但問題也很明顯,它的動作空間,並不完全等同於真實機器人部署時的動作空間。

所以在τ0-WM中,UMI資料更像是在補“行為多樣性”。

它不一定最精準,但能讓模型見過更多操作方式、更多物體、更多長尾場景。

第三類,則是3000小時的人類第一視角EgoCentric資料。

這部分資料的採整合本最低,但覆蓋範圍卻最大。

裡面會包含大量長尾互動行為,以及很多機器人暫時很難專門採集到的真實場景。

不過,它有一個問題:沒有機器人動作標籤。

也就是說,模型只能“看”,不能直接學“機器人該怎麼動”。因此,這部分資料只參與影片分支訓練,不參與動作預測。

它更像是在幫助模型學習:物體會怎麼運動,人與環境會怎麼互動,場景狀態會如何變化。

看到這裡,其實會冒出一個很自然的問題:

既然人類影片沒有動作標籤,UMI的資料格式又和真機動作空間不完全一致,那模型到底怎麼把它們一起訓進去?

τ0-WM這裡用了一個很巧的設計——Modality-specific supervision masks(模態特定監督掩碼)。

簡單來說,對於有動作標籤的資料,就同時訓練影片和動作,沒有動作標籤的資料,就把動作部分mask掉,只訓練視覺分支。

這樣一來,不同來源、不同模態、不同動作空間的資料,就第一次被真正揉進了同一個預訓練體系裡。

實驗結論

在實驗部分,團隊最核心想驗證的一件事,其實就是:

Test-Time Computation(測試時計算),到底有沒有用。

在抽紙巾放進盒子和撿筆放進盒子兩個任務上,這兩個任務在3萬小時預訓練資料中從未出現過,屬於模型完全沒見過的新任務。

研究採用了比常規做法更嚴格的評測標準,不允許重試,單次機會,20輪取平均。

結果表明,不加測試時計算時,裸策略平均成功率只有43%。加入第一層RCS動作篩選後,提升到50%。

再疊加LAR模擬器修正之後,最終來到60%。提升最明顯的是更難的Pen→Box任務,成功率直接從30%拉到了50%。

此外,研究還專門對比了其他測試時引導方法。同樣條件下,Classifier-Free Guidance(CFG)成功率只有20%,Action Coherence Guidance(ACG)為38%,τ0-WM則達到60%。

這裡最關鍵的區別就來自之前提到的,CFG和ACG,本質上還是在檢查“動作本身是否連貫”。

而τ0-WM評估的,則是:

“這個動作做完之後,未來世界會變成什麼樣,任務有沒有真的往前推進。”

也就是說,前者關注的是動作空間內部的一致性。

而後者,開始真正把“未來後果”納入了決策。

(其餘實驗細節可參考論文)

資料金字塔,要變樣了

如果放到整個具身智慧行業的資料路線裡看,τ0-WM這次真正特別的地方,其實會更明顯。

過去,具身行業的資料體系一直像一個很典型的金字塔。

最底層,是網際網路影片資料。

規模最大、最便宜,但沒有機器人動作標籤,只能讓模型學一些通用視覺和世界變化規律。

再往上一層,是模擬資料。

機器人終於開始“動起來”了,但問題在於,模擬和真實物理世界之間,始終隔著一道巨大的sim2real gap。

而金字塔最頂層,則是真機遙運算元據。質量最高,動作空間和真實部署完全一致,但行業過去的普遍認知一直是:

太貴、太少、根本不可能scale。

所以大多數團隊,都會把真機資料留到最後微調階段再用。

但今年,一個新的變化開始出現了,Ego-Centric第一視角資料突然崛起。

大家開始意識到,人類第一視角影片雖然沒有機器人動作標籤,但它天然包含了大量真實世界裡的互動過程、物體變化和長尾操作。

於是整個行業,開始集體all in Ego資料。

某種程度上,Ego-Centric正在變成資料金字塔裡的“新中層”,比網際網路影片更接近真實互動,又比真機資料便宜得多。

但問題是,絕大多數團隊做到這裡,其實就停下來了,因為大家仍然預設真機資料依然貴到不可能成為預訓練主體。

但τ0-WM第一次把這個邏輯反過來了。

他們一邊引入Ego-Centric資料,一邊直接用17800小時真機遙運算元據給預訓練打底。

這件事也不是突然發生的。

回看羅劍嵐團隊過去一年多的工作,會發現一條非常清晰的主線,他們搭的不是單點模型,而是一整套真實世界資料飛輪。

2026年1月,SOP搭起了規模化的真機資料採集和迴流基礎設施。

2026年4月,LWD把大規模強化學習引入具身VLA的後訓練,構建了部署即訓練的資料飛輪,機器人跑得越多,迴流資料越多,模型越強,又能跑更多工。失敗軌跡也第一次被系統性納入學習。

而當真機互動資料積累跨過某個臨界點之後,一件以前沒人敢想的事,就自然發生了:

真機資料終於開始從“後訓練耗材”,變成“預訓練燃料”。

直到這裡,具身智慧裡的“預訓練—真機部署—資料迴流—再預訓練”這條鏈路,才第一次真正開始跑通。

專案網站:

https://finch.agibot.com/research/tau0-wm專案github:

https://github.com/sii-research/tau-0-wm模型huggingface:

https://huggingface.co/sii-research/tau-0-wm

版權所有,未經授權不得以任何形式轉載及使用,違者必究。

上海創智學院 具身智慧 資料

衡宇

1400億Agent入場,“流量”這條護城河要塌了2026-05-27

AI原生時代下,讓世界適應Agent,而非教AI做人 | 港大黃超@AIGC20262026-05-31

Qwen最新3.7 Max預覽版空降!兩代超大杯並行迭代,林俊暘走了但還在加速2026-05-19

龍蝦之父月燒940萬元的token!要不是入職OpenAI還真用不起2026-05-17

相關閱讀

華人博士4個月幹出具身獨角獸!斯坦福家務機器人再融11億,開建中國團隊

2026,不再只做demo

henry2026-03-13

具身智慧 機器人

當200位具身從業者被拉進同一個屋子

做具身彆著急“堆資料”,先想透這些問題

鄧思邈2026-04-28

具身智慧 螞蟻集團 量子位沙龍

地瓜機器人再獲1.5億美元投資!B輪累計融資2.7億美元

全面加速全球化業務佈局

量子位2026-04-08

具身智慧 地瓜機器人 融資

離開馬斯克後,他把人形機器人做成了這樣

集齊特斯拉/輝達/OpenAI班底,最新產品曝光

鄧思邈2026-01-10

人形機器人 具身智慧 特斯拉 矩陣超智

π0.7釋出,VLA押出了機器人的GPT-3時刻

π0.7:具有湧現能力的可控模型

henry2026-04-17

具身智慧

宇樹機器人被曝漏洞,機器人之間可相互感染,官方火速回應

雙足四足都中招了

衡宇2025-09-30

具身智慧 宇樹 機器人 機器狗

熱門文章

剛剛,國產AI自己造了AI,全球首例!

2026-05-26

卡帕西Anthropic最新頭銜:技術員工(MTS)

2026-05-26

7B打敗o3、GPT-5!醫學AI智慧體讓模型學會“看哪裡、怎麼看”

2026-05-28

面壁智慧「開源周」:一場定義端側 AI 終局的系統性「亮劍」

2026-05-29

DeepSeek V4芯模協同背後,國產算力生態開始飛輪加速

2026-05-28

掃碼關注量子位

量子位 QbitAI 版權所有©北京極客夥伴科技有限公司 京ICP備17005886號-1

展開要點與分析

文章情報

工程師進階

要點

  • τ0-WM引數量5B,預訓練資料3萬小時,為全球最大開源預訓練具身世界模型。
  • 真機遙運算元據1.78萬小時首次成為預訓練主力,打破行業認知。
  • 線上推理採用提議-推演-評估三步,結合測試時計算實現機器人“慢思考”。
  • 在四個長程任務上平均成功率超π0.5和Fast-WAM,測試時計算貢獻明顯。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。