AI News HubLIVE
サイト内リライト2 分で読了

RealVDeblur: One-Step Diffusionによる汎用的な実世界ビデオデブラリング

RealVDeblurは、3Dガウシアンスプラッティングを用いた物理的ブレ合成パイプラインで現実的な訓練データを生成し、ビデオ拡散事前分布とワンステップ拡散蒸留を活用することで、実世界のビデオデブラリングを効率的に行う生成フレームワークである。未知のビデオに対して高い知覚品質、意味的忠実性、時間的一貫性を示し、深刻なモーションブラーの下での下流3D再構成のロバスト性も向上させる。

ソースarXiv Computer Vision著者: Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

実世界のビデオデブラリングは、多様な動きパターン、複雑な劣化、現実的な訓練データの不足により依然として困難な課題である。本稿では、Renbiao Jinらが提案するRealVDeblurを紹介する。これは、様々な実撮影条件下でのロバスト性を向上させる効率的な生成フレームワークである。

まず、シーンレベルの3Dガウシアンスプラッティング(3DGS)アセットと高フレームレートビデオから、物理的に基づいた大規模ブレ合成パイプラインを構築する。これにより、カメラ起因と物体運動によるブレの両方をカバーする現実的な訓練データが得られる。このパイプラインは、動的シーン再構築と高フレームレートサンプリングにより、複雑なモーションブラーパターンを模倣し、既存のデータセットと実際のブレとのギャップを埋める。モデルはより豊富な学習信号を得ることができ、従来の合成手法と比較して、生成される訓練データのリアリティと多様性が向上し、実シーンでの汎化能力が高まる。

復元段階では、ビデオ拡散事前分布の強力な生成能力を活用する。フレーム依存のブレ変動に対応するため、VAEの時間圧縮を無効にし、フレームごとの符号化方式を採用する。この設計により、フレーム間の情報混在を防ぎ、各フレームの独立した詳細が保持される。ビデオ拡散事前分布は潜在空間で反復的にノイズを除去し、クリアなビデオフレームを徐々に復元するとともに、グローバルな意味的一貫性を維持する。

長尺ビデオへの実用的な展開に向けて、研究チームは知識蒸留によりマルチステップ拡散サンプリングプロセスを効率的なワンステップ生成器に圧縮した。この蒸留プロセスは、教師モデル(マルチステップ拡散)と生徒モデル(ワンステップ生成器)の出力差を最小化することで、生徒モデルが少ないサンプリングステップで教師と同等の性能を発揮できるようにする。さらに、訓練不要の時間窓マスク(Temporal Window Mask)を導入する。このマスクは、時間方向にスライディングウィンドウ戦略を適用することで、訓練時間範囲を超えた推論を一定のメモリ使用量で安定して実行できる。この革新により、RealVDeblurは任意の長さのビデオシーケンスをメモリ不足や性能低下の心配なく効率的に処理できる。

多様な実世界ベンチマーク(屋外シーン、手持ち撮影、高速運動など)での実験により、RealVDeblurは未知のビデオに対して高い知覚品質、意味的忠実性、時間的一貫性を達成した。特に深刻なモーションブラーの下で、下流の3D再構成のロバスト性が向上し、実用的価値が確認された。コードとプロジェクトページは公開されており、研究者が再現や改良を行うことができる。今後、このフレームワークはモバイルイメージング、ビデオ監視、拡張現実などの分野に応用され、実世界ビデオ処理技術の進歩を促進することが期待される。