超越玩笑:多角度推理检测并解释模因中的有害幽默
互联网模因融合了视觉、文本和文化背景,使得幽默、讽刺与恶意共存的情况难以解读。现有多模态分类器要么忽略这些相互依赖关系,要么可解释性有限。本文提出MAR-12框架,利用视觉语言模型(VLM)从12个结构化视角解读模因,通过角色感知软门控注意力机制学习各视角贡献,再基于原型分类器进行预测,并综合视角推理和注意力权重生成解释。在PrideMM和Memotion数据集上,幽默检测准确率达80.3%,仇恨检测达75.9%,优于现有方法,且生成的解释连贯可信。
互联网模因(memes)作为一种融合图像、文本和文化背景的复合媒介,已经成为社交媒体上表达幽默、讽刺甚至仇恨的主要形式。然而,当幽默与恶意意图同时存在时,准确识别其中的含义和意图变得极具挑战。传统的多模态分类器往往将视觉和文本信息分开处理,忽略了它们之间的复杂相互作用,并且缺乏透明、可解释的推理过程。这种局限性在实际应用中尤为突出,例如在内容审核中,不仅需要判断模因是否包含仇恨言论,还需要提供清晰的解释以支持审核决策。
针对这一挑战,来自Shanhong Liu等五位研究人员提出了MAR-12(Multi-Angle Reasoning with 12 perspectives)框架,该工作已被AAAI-ICWSM 2027会议接收。MAR-12的核心思想是通过多个理论驱动的视角来系统地分析模因,从而揭示幽默和仇恨元素之间的动态关系。该框架首先利用视觉语言模型(VLM)从12个不同的视角(例如,基于幽默理论的视角、基于仇恨理论的视角)对每个模因进行初步解析。这些视角覆盖了视觉线索、文本语义、文化背景、情感基调等多个维度,确保对模因的多方面理解。
接下来,MAR-12引入了一种角色感知的软门控注意力机制(role-aware soft-gated attention)。这个机制能够自动学习每个视角对于最终分类的重要性,即哪些视角在特定模因中更为关键。这种动态加权方式使得模型能够根据实际输入调整关注重点,例如当图像中包含明显的仇恨符号时,与该符号相关的视角权重会更高。然后,框架使用一个基于原型的分类器(prototype-based classifier)来生成最终的预测结果。原型分类器的优势在于它能够将每个类别的代表性特征抽象为原型,从而增强分类的可解释性。最后,MAR-12综合各视角的推理过程和注意力权重,生成自然语言解释。这些解释不仅指出了模因中的幽默和仇恨元素,还说明了它们是如何共同作用导致最终判断的。
实验在PrideMM和Memotion两个公开数据集上进行。PrideMM专注于模因中的幽默与攻击性检测,而Memotion则侧重于情感和幽默分析。结果显示,MAR-12在幽默检测上达到了80.3%的准确率,在仇恨检测上达到了75.9%的准确率,均超过了现有的最先进方法。更值得注意的是,通过人类评估和基于GPT-4的自动评估,MAR-12生成的解释被评价为连贯、有说服力,并且在幽默与有害信号同时存在的模因上表现尤为突出。这表明该框架不仅提升了分类性能,还显著增强了模型的可解释性和可信度。
这项研究的重要意义在于,它为可解释的模因理解系统提供了一个新的范式。在社交媒体内容审核、在线安全监测等实际应用中,准确性与可解释性同等重要。MAR-12通过结构化的多视角推理和透明化的注意力加权,使得模型决策过程不再是一个“黑箱”,而是可追溯、可验证的。此外,该框架的理论驱动视角设计也鼓励进一步探索其他领域(如讽刺检测、文化敏感分析)中的多角度推理方法。论文的代码和数据集尚未公开,但作者计划在后续工作中发布,以促进社区的进一步研究。