MIME:多模態互動運動編碼器
本文介紹了多模態互動運動編碼器(MIME),這是首個專為雙人互動運動設計的多模態編碼器。MIME透過基於流的共注意力機制、顯式互動特徵和基於課程的對比訓練,捕捉個體與共享結構。在Inter-X文本-運動檢索任務中,MIME顯著優於基線方法,在2000樣本庫中文本到運動R@1相對提升12.8%。作為凍結的輔助先驗,MIME在TIMotion和InterMask中提升了語義對齊指標,同時保持了相當的FID分數,表明互動感知的多模態編碼能夠提升多人運動檢索並遷移至下游運動生成任務。
近年來,文本-運動表徵學習取得了顯著進展,尤其在多人物互動場景中,如動畫、增強現實/虛擬現實(AR/VR)和具身人工智慧等領域受到了廣泛關注。這些應用要求表徵能夠將自然語言描述與個體運動動態及其互動關係精確對齊。然而,傳統方法通常採用早期融合或晚期融合策略,難以有效捕捉雙人之間的共享互動結構。為此,來自研究團隊(Addison Zucek等人)提出了多模態互動運動編碼器(MIME),據我們所知,這是首個專門為雙人互動運動設計的多模態編碼器。
MIME的核心創新在於其獨特的架構設計。它採用基於流的共注意力機制,將兩個人的運動序列分別視為獨立的資料流,透過共注意力層互動資訊,同時引入顯式互動特徵(如相對位置、距離、朝向等)來增強對互動關係的建模。此外,MIME採用了基於課程的對比訓練策略,從簡單的負樣本開始逐步過渡到更難的負樣本,從而更有效地學習個體與共享結構的區分性表示。在Inter-X資料集上的文本-運動檢索實驗中,MIME在不同規模的檢索庫中均優於早期融合和晚期融合基線方法,特別是在包含2000個樣本的庫中,其文本到運動檢索的R@1指標相對提升了12.8%。
為了驗證MIME的泛化能力,研究團隊進一步將其作為凍結的輔助先驗,整合到兩個運動生成框架中:文本到運動生成模型TIMotion和運動修復模型InterMask。在未見過的InterHuman資料集上進行評估,結果表明,MIME顯著提升了語義對齊指標(如R精度等),同時保持了與基線相當的FID分數。這些成果證明,互動感知的多模態編碼不僅能夠改進多人運動檢索,還能跨資料集遷移,有效支援下游的運動生成任務。
該論文目前正在接受2027年IEEE冬季計算機視覺應用會議(WACV 2027)的審稿,提交時間為2026年7月18日。MIME的提出為互動式運動理解與生成領域提供了新的思路,有望推動虛擬角色動畫、人機互動以及具身智慧技術的發展。