AI News HubLIVE
站內改寫2 分鐘閱讀

Bunraku:將單張插圖轉化為可編輯的Live2D角色

該研究提出Bunraku系統,首次實現從單張插圖端到端生成Live2D角色所需的所有結構化資料,包括有序RGBA圖層、每層變形網格和引數驅動的關鍵姿態頂點偏移。透過分層擴散與聯合預測,系統能生成連貫角色,併發布了Live2D-Bench基準和包含8884個模型的資料集。

來源arXiv Computer Vision作者: Junhao Chen, Jingjia Mao, Dayong Li, Chenghai Li, Saining Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

Live2D是動漫角色和虛擬主播領域主流的2D角色動畫格式。它把一個角色拆分成多層RGBA影像,並用每層獨立的網格形變來驅動動作。這項技術在虛擬直播、手機遊戲和互動式角色中應用非常廣泛,但建立一個Live2D模型仍然是高度依賴人工的過程:創作者需要手動完成圖層拆分、遮擋補全、網格鋪設和關鍵幀設定,通常要耗費數週時間。更關鍵的是,此前沒有任何生成式方法能夠端到端地產出這種結構化資產。

針對這一空白,研究團隊提出了Bunraku系統。這是第一個能夠僅憑一張普通插畫,就生成Live2D執行時所需的全部結構化資訊的系統:有序的RGBA圖層、每個圖層對應的形變網格,以及讓角色動起來的引數化關鍵姿態頂點偏移。系統分成兩個階段。第一階段把圖層拆分建模為一個分層擴散過程,並藉助一套面向Live2D的器官級分類體系,在生成有序RGBA堆疊的同時完成被遮擋區域的補全。第二階段則從每個圖層的alpha通道直接構建貼合內容的三角形網格,然後對所有圖層的關鍵姿態位移場進行聯合預測。具體來說,每個圖層的每個頂點都被視為一個token,自注意力機制跨越圖層邊界,而每個位移被分解為有界的方向和標量級的對數。

研究團隊在實驗中發現,聯合預測而不是逐層獨立預測,是讓最終結果成為連貫角色而非一堆獨立合理部件的最關鍵因素,也是整個方法中收益最大的設計決策。相比之下,把網路規模擴大112倍幾乎沒有帶來任何提升。在50個保留角色上,採用無教師強制的真實生成設定,第二階段取得了每頂點方向餘弦0.768(中位數0.828)的成績。由於每個圖層的網格完全由它的alpha通道決定,因此像衣物這樣的圖層可以直接透過自然語言指令重新紋理化,而網格和已經預測好的動畫可以逐位元組複用。

此外,團隊還發布了Live2D-Bench,這是該任務第一個標準化的評測基準,以及一個包含8884個模型並帶有圖層與動畫監督資訊的Live2D語料庫。這些資源將為後續研究提供標準化的比較平臺,也有望大幅降低Live2D內容的製作門檻,推動自動化和可編輯角色生成技術的進一步發展。