闭合循环:无需训练的自回归生成渲染中的重访一致性
最近的条件视频生成模型能够将深度图等3D引擎渲染结果转换为逼真视频,但在长时间自回归生成中,当相机重访之前位置时,由于KV缓存已清空,会出现不一致的外观。本文提出一种无需额外训练的方法,利用3D引擎提供的对应关系:时间对应检索历史潜在块作为闭环记忆,空间对应通过相机姿态和深度重投影引导注意力,从而在保持视频质量的同时显著提升重访一致性。在TartanAir和TartanGround数据集上的实验表明,该方法优于现有无训练基线。
近日,一篇题为《Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering》的论文提交至arXiv,提出了一种无需额外训练的方法,用于解决自回归视频生成模型在相机重访时出现的外观不一致问题。该论文由Wenchao Ma等四位作者完成,旨在提升游戏和沉浸式内容创建中3D渲染到逼真视频转换的长期一致性。
背景与问题
近年来,条件视频生成模型在将3D引擎渲染(如深度图、未纹理几何体)转换为逼真视频方面展现出巨大潜力。这类应用通常需要长时间的自回归生成,即连续合成新帧同时维持一个持久的3D世界。然而,自回归生成器基于有界的KV缓存逐块合成视频,当相机在上下文被清除后重访某个位置时,即使条件渲染(如深度图)与底层几何完全对齐,模型也常常生成不一致的外观。这种“重访不一致”成为制约长期生成质量的关键瓶颈。
方法创新
针对上述问题,论文提出一种无需任何后训练的方法,巧妙地利用了3D引擎已提供的对应关系。具体来说,该方法包含两个核心机制:时间对应和空间对应。时间对应机制通过检索与当前姿态匹配的历史潜在块,将其作为闭环记忆重新注入KV缓存;空间对应机制则利用相机姿态和深度重投影,在token级注意力中偏向于检索块中几何对应的区域。这种双管齐下的策略使得模型在重访时能够有效复用之前生成的内容,从而保持外观一致性。
实验结果
作者们在TartanAir和TartanGround数据集中挖掘的闭环轨迹上进行了评估,这些轨迹模拟了复杂的真实应用场景。实验结果显示,该方法在重访一致性上显著优于现有的无训练基线,同时没有牺牲整体视频质量。相关代码和项目页面已公开,供研究者进一步探索。
这项研究为自回归生成渲染中的长期一致性问题提供了一种轻量级且高效的解决方案,有望推动游戏引擎和沉浸式内容制作的实际应用。