AI News HubLIVE
サイト内リライト2 分で読了

マルチホライズン一貫性を幾何学として:潜在ダイナミクスが収縮するとき、収縮しないとき

この研究は、マルチステップ潜在一貫性の重みλを診断ツールとして用い、ビデオ予測器や世界モデルにおける潜在ダイナミクスの幾何学に与える影響を探る。Moving-MNISTではλを上げると潜在膨張と予測誤差が大幅に減少するが、アクション条件付き環境ではその効果は見られず、ドメイン限定であることを示す。確率的強制則により異なるドメインの曲線が統一される。

ソースarXiv Machine Learning著者: Kavya Bhand, Aadi Joshi

arXiv 2607.21645号の論文「マルチホライズン一貫性を幾何学として:潜在ダイナミクスが収縮するとき、収縮しないとき」(著者:Kavya Bhand、Aadi Joshi)は、ビデオ予測器や世界モデルにおけるマルチステップ潜在一貫性の重みλが潜在状態遷移の幾何学に与える影響を体系的に調査した。

研究では、λを診断制御変数として扱い、潜在膨張の代理指標L20(q95分位に基づく)と20ステップ予測誤差E20を測定した。Moving-MNISTデータセット(6つのランダムシード)では、λを0から0.8に上げるとL20が4.96±2.01から1.01±0.06に有意に減少し(対応t検定p=0.005、Wilcoxon検定p=0.031)、E20は0.365から0.177に半減した(対応t検定p=1.1e-13)。6シード中4つがλ=0.8でL<1の収縮状態に達した。

しかし、同じ損失関数はアクション条件付き環境(Pendulum-v1、CartPole-v1)やKTH行動ビデオデータセットではL<1の全体的な収縮を生じず、E20が改善した場合でも同様だった。媒介分析(Moving-MNIST、n=27、B=2000)ではr-hat=0.94(95% CI [0.88, 1.00])が得られ、λが収縮を誘発することで間接的に誤差を減少させることが示唆されたが、λは無作為化されていない。

防御的チェック(アーキテクチャベースライン、外因性ストレステスト、WorldTest、モデル予測制御、スケーリング実験)は全体として、ソフト一貫性が受動ビデオをほぼ収縮的なバンドに押しやる可能性があるが、そのバンドはドメイン限定であるという狭い主張を支持した。確率的強制則L20 ~ 1.23 + 1.82η(λ=0.8時、ブートストラップ傾き信頼区間[1.73, 1.92]、R²=0.96)は、較正されたη_effを介して制御ドメインを同一曲線上に統一した。λ=0.4と1.2での完全な結合スライス(30/30セル、5 η値×3シード)は同様の線形L20(η)傾き(約1.69と2.00)を示したが、論文は連続的な(λ, η)曲面を適合させていない。

この研究は、マルチホライズン一貫性がシナリオによって異なる影響を及ぼすことを明らかにし、世界モデル訓練におけるハイパーパラメータ選択に幾何学的視点を提供する。

マルチホライズン一貫性を幾何学として:潜在ダイナミクスが収縮するとき、収縮しないとき | AI News Hub