多視野一致性作為幾何結構:潛在動力學何時收縮,何時不收縮
該研究將多步潛在一致性權重λ作為診斷工具,探索其對影片預測器和世界模型中潛在動力學幾何結構的影響。在Moving-MNIST上,提高λ顯著降低潛在膨脹和預測誤差,但在動作條件化的環境中無此效果,表明其作用域有限。透過隨機強迫律統一了不同領域的曲線。
arXiv 2607.21645號論文《多視野一致性作為幾何結構:當潛在動力學收縮時與不收縮時》由Kavya Bhand和Aadi Joshi提交,系統研究了多步潛在一致性權重λ對影片預測器和世界模型中潛在狀態過渡幾何的影響。
研究中,作者將λ視為診斷控制變數,測量了潛在膨脹代理指標L20(基於q95分位數)和20步預測誤差E20。在Moving-MNIST資料集上(6個隨機種子),將λ從0提高到0.8導致L20從4.96±2.01顯著降至1.01±0.06(配對t檢驗p=0.005,Wilcoxon檢驗p=0.031),同時E20從0.365降至0.177(配對t檢驗p=1.1e-13)。六個種子中有四個在λ=0.8時達到了L<1的收縮狀態。
然而,相同的損失函式在動作條件化環境(Pendulum-v1和CartPole-v1)以及KTH行為影片資料集上並未產生L<1的總體收縮,即便E20有所改善。中介分析(基於Moving-MNIST,n=27,B=2000)顯示r-hat=0.94(95% CI [0.88, 1.00]),表明λ透過誘發收縮間接降低了誤差,但λ並非隨機分配。
防禦性檢查(包括架構基線、外生壓力測試、WorldTest、模型預測控制及縮放實驗)總體支援一個窄域主張:軟一致效能夠推動被動影片向近似收縮的帶狀區域發展,但這種帶狀區域受領域限制。一個隨機強迫律L20 ~ 1.23 + 1.82η(在λ=0.8時,自舉斜率置信區間[1.73, 1.92],R²=0.96)透過校準的η_eff將控制域統一到同一曲線上。在λ=0.4和1.2下的完整聯合切片(30/30單元格,5個η值×3個種子)顯示出類似的線性L20(η)斜率(約1.69和2.00),但論文未擬合連續的(λ, η)曲面。
該研究揭示了多視野一致性在不同場景下的差異化影響,為世界模型訓練中超引數選擇提供了幾何視角。