Bunraku:将单张插图转化为可编辑的Live2D角色
该研究提出Bunraku系统,首次实现从单张插图端到端生成Live2D角色所需的所有结构化数据,包括有序RGBA图层、每层变形网格和参数驱动的关键姿态顶点偏移。通过分层扩散与联合预测,系统能生成连贯角色,并发布了Live2D-Bench基准和包含8884个模型的数据集。
Live2D是动漫角色和虚拟主播领域主流的2D角色动画格式。它把一个角色拆分成多层RGBA图像,并用每层独立的网格形变来驱动动作。这项技术在虚拟直播、手机游戏和交互式角色中应用非常广泛,但创建一个Live2D模型仍然是高度依赖人工的过程:创作者需要手动完成图层拆分、遮挡补全、网格铺设和关键帧设定,通常要耗费数周时间。更关键的是,此前没有任何生成式方法能够端到端地产出这种结构化资产。
针对这一空白,研究团队提出了Bunraku系统。这是第一个能够仅凭一张普通插画,就生成Live2D运行时所需的全部结构化信息的系统:有序的RGBA图层、每个图层对应的形变网格,以及让角色动起来的参数化关键姿态顶点偏移。系统分成两个阶段。第一阶段把图层拆分建模为一个分层扩散过程,并借助一套面向Live2D的器官级分类体系,在生成有序RGBA堆栈的同时完成被遮挡区域的补全。第二阶段则从每个图层的alpha通道直接构建贴合内容的三角形网格,然后对所有图层的关键姿态位移场进行联合预测。具体来说,每个图层的每个顶点都被视为一个token,自注意力机制跨越图层边界,而每个位移被分解为有界的方向和标量级的对数。
研究团队在实验中发现,联合预测而不是逐层独立预测,是让最终结果成为连贯角色而非一堆独立合理部件的最关键因素,也是整个方法中收益最大的设计决策。相比之下,把网络规模扩大112倍几乎没有带来任何提升。在50个保留角色上,采用无教师强制的真实生成设置,第二阶段取得了每顶点方向余弦0.768(中位数0.828)的成绩。由于每个图层的网格完全由它的alpha通道决定,因此像衣物这样的图层可以直接通过自然语言指令重新纹理化,而网格和已经预测好的动画可以逐字节复用。
此外,团队还发布了Live2D-Bench,这是该任务第一个标准化的评测基准,以及一个包含8884个模型并带有图层与动画监督信息的Live2D语料库。这些资源将为后续研究提供标准化的比较平台,也有望大幅降低Live2D内容的制作门槛,推动自动化和可编辑角色生成技术的进一步发展。