AI News HubLIVE
站内改写1 分钟阅读

Oxygen-TryOn:面向任意物品虚拟试穿的时尚原生基础模型

Oxygen-TryOn是一种统一的任意物品虚拟试穿基础模型,专为试穿任务设计,而非通用图像编辑器的改造。它利用专用数据引擎和试穿特定训练,支持多种参考物品(如产品图或日常穿搭照片)和目标人物图像,生成逼真的试穿效果。与传统单品类或仅注重衣物的方法不同,Oxygen-TryOn支持全/半身视图、可变参考数量、自由多物品组合,同时保持人物身份和物品外观。它采用三阶段训练策略(CPT、SFT、RL),并在RL阶段结合内部试穿奖励模型和专有通用模型。在公开基准和内部测试中,它在单物品试穿上达到最先进水平,在多物品试穿上领先,匹敌或超越领先的商业和开源系统。

来源arXiv Computer Vision作者: Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

Oxygen-TryOn是一种全新的虚拟试穿基础模型,专为任意物品的试穿而设计,彻底改变了传统试穿系统仅能处理单一品类或仅关注衣物的局限性。与那些从通用图像编辑器改造而来的方法不同,Oxygen-TryOn从数据到训练都围绕试穿任务构建,真正做到了“时尚原生”。它的核心创新在于“多参考理解驱动生成”框架。给定一个或多个参考物品(可以是干净的产品图,也可以是日常穿着的照片)以及一张目标人物图像,Oxygen-TryOn能够合成一张逼真的试穿图像,人物穿着这些物品,几乎涵盖所有时尚品类。无论是全半身视图、可变的参考数量,还是自由组合多件物品,它都能应对,并忠实保留人物身份和物品细节。

为了实现如此强大的能力,研究团队构建了一个专门的数据引擎,用于大规模收集、制造、标注和过滤高质量的试穿数据。训练过程分为三个阶段:持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在RL阶段,他们设计了一种混合奖励模型,结合了内部的试穿奖励模型和一个专有的基于规则的通用模型,共同监督细粒度的一致性和指令级别的质量。这使得模型不仅能完成基本的试穿,还能服从一般的编辑指令,例如改变姿态。

在公开基准和内部构建的Oxygen-TryOn Bench上,该模型在单物品试穿任务中达到了最先进的一致性和逼真度,在多物品试穿中更是领先。无论是与领先的商业系统(如Nano Banana Pro、GPT-Image-2、Seedream5 Lite)还是开源模型(如FLUX.2)相比,Oxygen-TryOn都展现出了匹敌甚至超越的性能。总之,Oxygen-TryOn为虚拟试穿领域树立了新的标杆,其通用性和高性能有望在电商、时尚设计等场景中发挥重要作用。

Oxygen-TryOn:面向任意物品虚拟试穿的时尚原生基础模型 | AI News Hub