面向部分标注的多任务面部情感识别的共享潜变量
提出一种共享潜变量方法,通过变分瓶颈在部分标注的多任务面部情感识别中实现跨任务信号共享,在s-Aff-Wild2数据集上提升表情识别宏F1至0.446,并通过第二个骨干网络突破动作单元瓶颈。
本文提出了一种针对部分标注的多任务面部情感识别的新方法。真实环境中的面部情感本质上是多任务的:效价-唤醒度、离散表情和面部动作单元都描述了同一张脸。然而,现有数据集对这些任务的标注往往是部分且不均匀的,例如s-Aff-Wild2数据集中只有37%的帧同时具有全部三类标签。传统方法通常直接掩盖缺失标签或使用伪标签,从而忽略了跨任务的有用信号。作者认为,这种处理方式浪费了多任务之间的潜在关联,因为同一张脸的不同情感表征应该共享底层信息。
为了解决这一问题,作者提出将部分标注的多任务学习视为对共享情感潜变量的边缘化问题。具体来说,他们引入了一个变分瓶颈,该瓶颈作为三个任务解码器(分别对应效价-唤醒度、离散表情和动作单元)的中间表示。这样一来,只要一帧图像有任何一个任务的标注,就能通过共享潜变量影响其他任务的表示。原本被掩盖的损失函数以证据下界(ELBO)的重建项形式重新出现,从而实现了对缺失标签的自然处理,而无需显式地填充或掩码。
在s-Aff-Wild2数据集上的实验表明,单独使用一个骨干网络时,该方法将表情识别的宏F1分数从专门模型的0.403提升至0.446,而传统掩码损失模型无法达到这一水平。这一提升在统计上是显著的,并且通过匹配的控制负例验证了其可靠性。进一步,通过引入第二个近乎相同的骨干网络并利用其去相关的误差,该方法突破了动作单元的识别上限——这一上限即使是利用外部动作单元数据也无法突破,同时效价-唤醒度的性能保持在噪声水平内。作者认为,这表明多任务共享信号对动作单元的识别有独特帮助,而单一任务或外部数据难以提供同样的增益。
控制实验是本文的重要部分。作者精心设计了多个对照实验,包括使用匹配的控制负例来排除假阳性。这些实验表明,稀有类别的失败主要源于表示能力不足,而非损失函数的形状问题。换言之,模型不是因为损失函数偏向常见类别而失败,而是因为共享潜变量未能充分捕捉稀有类别的特征。这为未来改进提供了明确的方向:增强共享表示的多样性或引入类别平衡机制。
由于每个任务的数据来源在评估划分时被选择,作者报告了验证集上的综合多任务分数1.679作为样本内端点,其结论主要基于控制比较。此外,他们还展示了表情识别优势在AffectNet和RAF-DB数据集上的小规模、依赖特定条件的迁移,但将其视为探索性结果而非结论性证据。总体而言,这项研究为部分标注的多任务学习提供了一个优雅的理论框架,并在具有挑战性的基准上取得了实质性改进,对情感计算领域具有重要参考价值。
(注:本文内容基于arXiv预印本2607.16285,作者包括Hong Hai Nguyen等人,提交于2026年7月11日。)