知识引导的原子动作解缠用于动作识别
本文提出知识引导的原子动作解缠(KDA)方法,利用大语言模型将动作标签分解为原子动作,通过知识注入和解缠模块增强视频特征,实现细粒度动作识别,在多标签动作识别基准上取得最优性能。
在计算机视觉领域,复杂场景中的动作识别常常涉及多个并行的细粒度动作,这使得对内部动作结构的建模变得极具挑战性。现有的大多数方法依赖于整体表示,难以捕捉细微的交互和细粒度语义。尽管最近基于提示的方法引入了某种解缠机制,但它们缺乏显式的语义指导,而仅基于视觉或结构化线索的方法仍然停留在粗粒度层面。
为了突破这一局限,来自田纳西大学等机构的研究团队提出了一种名为“知识引导的原子动作解缠”(Knowledge-guided Disentanglement with Atomic Actions, KDA)的新方法。该方法通过利用细粒度语义知识来增强动作表示,实现更精确的解缠。具体而言,KDA首先借助大语言模型(LLMs)将动作标签分解为原子动作,为每个原子动作提供明确的时空语义描述。这些原子动作代表了构成复杂动作的基本单元,例如“挥手”、“跳跃”等,使得模型能够更细致地理解视频内容。
在此基础上,KDA设计了两个核心模块:知识注入模块(KIM)和知识解缠模块(KDM)。KIM负责将原子动作知识融入视频特征中,形成增强表示;随后KDM进一步解缠这些原子动作知识,生成更精细的语义指导,以辅助最终的动作解缠过程。此外,研究团队还引入了一种知识解缠损失函数(KD Loss),通过鼓励KDM内部知识组件的清晰分离,提升了模型的可解释性和性能。
大量实验表明,KDA能够显著提升特征的可判别性,并在多个多标签动作识别基准数据集上取得了最先进的性能。例如,在Charades和Multi-Thumos等数据集上,KDA超越了先前的方法,验证了其有效性。更重要的是,KIM和KDM两个模块具有良好的通用性,可以轻松集成到其他现有的动作识别方法中,如TSM和I3D,进一步验证了它们的广泛适用性。该研究已被ACM MM 2026会议接收,并提供了详细的代码和实验设置供社区复现。
总体而言,KDA通过将LLMs的语义知识与视频特征学习相结合,为解决复杂场景中的细粒度动作识别提供了新思路,有望推动视频理解技术的发展。