AI News HubLIVE
站内改写1 分钟阅读

RMS@CC-MMD 2026:通过几何交互和多视角共识进行多模态厌女检测

该论文提出GeoMVC模型,利用几何交互层和多视角共识策略检测厌女模因,在CC-MMD挑战中马拉雅拉姆语和中文分区取得优异成绩。

来源arXiv Computer Vision作者: Md. Ajwad Hossain

互联网模因的泛滥为自动内容审核带来了新的挑战,尤其是在检测厌女内容方面。模因常常利用视觉和文本模态之间的语义冲突,仇恨意图隐含且具有文化背景。为此,研究人员提出了GeoMVC(几何交互和多视角共识)模型,用于ICMI 2026的CC-MMD大挑战赛。该模型的核心创新在于几何交互层,它通过哈达玛积和余弦相似度在冻结的视觉和文本嵌入之间建模跨模态对齐,替代了传统的静态特征拼接。此外,为了应对噪声OCR和代码混合音译(如Dravidian语言中的罗马化)带来的分布偏移,模型采用了多视角共识策略,聚合来自原始、长度过滤和英文翻译文本视图的预测。在任务A的评估中,GeoMVC在马拉雅拉姆语分区取得了Macro F1为0.892的成绩,排名第二;在中文分区取得0.895,排名第三;而在泰米尔语分区则因本地化音译和讽刺性代码混合的挑战,仅以0.521的Macro F1排名第五。开发集上的详细错误分析揭示了跨Dravidian和中国文化背景下建模本地化音译和代码混合讽刺的开放难题。该论文已被ICMI 2026接收。总之,GeoMVC通过几何交互和多视角共识有效提升了模因厌女检测的性能,但本地化和文化差异仍是未来研究的重要方向。