AI News HubLIVE
站內改寫2 分鐘閱讀

Induction Labs推出Photon-1:從一次預訓練中模擬桌面、下跳棋並建模檯球物理

大多數從影片中學習的智慧體需要知道每個幀是由什麼動作產生的。Induction Labs認為這一需求是瓶頸。上週,他們釋出了想象模型(imagination models),這是一種無需任何動作標籤即可在原始影片上進行預訓練的基礎模型架構。其測試系統Photon-1是一個稀疏的106B-A5B混合專家(MoE)模型,在18年的計算機演示影片上訓練。在內部計算機使用基準測試中,Photon-1以遠少於Gemini 3.1 Flash-Lite的預訓練計算量和約3倍的推理成本,擊敗了後者。

來源MarkTechPost作者: Michal Sutter

Induction Labs近日釋出了Photon-1,一個基於想象模型架構的稀疏混合專家(MoE)網路,引數量為106B(啟用引數5B)。該模型的核心突破在於:無需任何動作標籤,僅透過分析計算機螢幕錄製影片,即可學習執行任務的能力。傳統影片智慧體需要知道每一幀對應的具體操作,而Photon-1透過預測下一個幀的潛在表示,隱式學習了使用者行為模式。

Photon-1採用了一種高效的視覺編碼器,基於有限標量量化(FSQ)技術,將每幀壓縮為960個離散令牌,每個令牌為8維向量,每個維度取值於{-1, -1/2, 0, 1/2, 1},從而形成5^8種可能編碼。這種編碼每幀僅佔約2.2 KB,相比OCR和多模態方法實現了超過100倍的壓縮比,同時保留文本、佈局和狀態變化資訊。為了實現如此高的壓縮率,Photon-1使用了差分潛在編碼器,將影片幀作為對進行編碼,從而捕捉幀間差異而非幀內容本身。

在資料方面,Induction Labs從內部索引的20億公共影片中篩選出約200萬個計算機螢幕錄製影片,再透過關鍵幀檢測去除冗餘幀,最終得到5.75億幀資料集,取樣率為1幀/秒,相當於18年的影片時長,共5520億令牌。Photon-1在此資料集上從頭訓練了一個epoch,使用32K上下文長度,消耗約30,000個H200 GPU小時,計算量約為4.4×10²² FLOPs。訓練基於PyTorch實現,並針對視覺編碼器和MoE層定製了融合核心,保持了40%的端到端模型利用效率(MFU)。

為了將模型從想象轉化為實際行動,研究團隊在少於35,000條計算機使用軌跡上對Photon-1進行了微調,使其學習動作和指令格式。微調後,模型在推理時首先預測下一幀狀態,然後輸出到達該狀態所需的動作。此外,他們還採用了線上強化學習,在虛擬機器中大規模執行真實桌面環境(包括LXQt、Xfce、MATE、GNOME和Plasma),並透過程式化驗證給出獎勵訊號。

在效能對比上,Photon-1僅使用0.044×10²⁴ FLOPs的預訓練計算量,而Gemini 3.1 Flash-Lite約為1.2×10²⁴ FLOPs,相差約27倍。在內部計算機使用基準測試中,Photon-1超越了Gemini 3.1 Flash-Lite,且推理成本僅為後者的約三分之一。不過需注意,該結果為Induction Labs內部評估,尚未獨立驗證。

更令人驚訝的是Photon-1的泛化能力。儘管僅在桌面影片上預訓練,但經過微調後,它在國際跳棋(20,000局公開棋局)和檯球物理模擬(10,000局合成資料)任務上,均顯著優於同規模的視覺編碼基線與Ling-flash-2.0大語言模型基線。在臺球任務中,Photon-1的均絕對誤差(MAE)僅為0.47,遠優於LLM基線的1.15和視覺基線1.44。此外,模型還透過強化學習學會了使用虛擬機器內的ChatGPT克隆體來起草內容或回答知識問題,體現了人類操作者的行為偏好。

儘管成果令人印象深刻,但Induction Labs目前未公開模型權重、API或許可證,本工作僅為研究性成果。完整的技術白皮書已在官網釋出。