Axolotl3D:一种统一的忠实3D形状补全框架
Axolotl3D提出了一种多模态、遮挡感知的3D生成模型,能够联合处理图像、可见性掩模、相机参数和部分点云,实现可靠的3D形状补全。实验表明,在干净和遮挡场景下均达到最优性能。
现有的3D生成模型通常假设输入图像中物体完全可见且来自单一视角,因此当面对多视角、部分遮挡或需要编辑的场景时,其性能会大幅下降。虽然已有工作尝试分别解决这些问题,但缺乏一个统一的框架来应对多种条件信号。针对这一挑战,来自MIT的研究人员Anita Hu和Maria Shugrina提出了Axolotl3D,这是一种多模态且对遮挡敏感的3D生成模型,能够同时利用图像、可见性掩模、相机参数和部分点云信息,实现对3D形状的忠实补全。
Axolotl3D的核心创新在于:部分点云作为几何锚点,确保生成的形状与输入保持一致;相机参数则保证了在多视角下,生成的形状在共享的3D坐标系中能正确对齐。模型采用统一的训练策略,从大规模3D数据中合成多样化的条件组合,从而具备了强大的跨模态推理能力。在Toys4K和OmniObject3D数据集上的实验表明,无论是在干净设置还是遮挡设置下,Axolotl3D都达到了最先进的性能。此外,该框架在真实世界重建和几何一致性编辑任务中也表现出色,证明了其在实际应用中的潜力。该论文已被ECCV 2026接收。