在自然语言处理领域,理解语言的表层含义之外,模型还需要掌握社交语境中的言外之意。一篇题为《你真的没看懂吗?——中文网络评论间接与戏谑用语的社交语用推理基准测试》的论文,近期在arXiv平台上发布,并已被2026年自然语言处理实证方法会议(EMNLP 2026)主会接收。该研究由史伟宏(Shiwei Hong)与另外七位作者共同完成,主要关注中文社交媒体评论中普遍存在但难以处理的间接、戏谑表达。研究者指出,中文网络评论经常通过反讽、夸张、隐喻、反话等手法传递社交意义,这类表达高度依赖上下文,真实交流中的互动语境对于解读至关重要。然而,现有评测体系往往按照预设的语言现象或受控的语用分类安排测试项目,这并不能真实反映模型是否能够理解一段自然出现的评论在具体对话互动中实际发挥的作用。为了弥补这一空缺,他们设计了一个全新的基准测试。该基准测试的构建过程十分严谨。首先,研究团队收集了超过二十万条公开的中文社交媒体互动记录,从中筛选并重构出带有前文语境的评论片段。他们为每条目标评论设计了可能被误读的干扰选项,最终构建了4735个经过人工验证的诊断条目。每个条目都包含一条目标评论、重构出的对话前文,以及若干合理但错误的解读选项。这样的设计使模型不仅需要判断句子本身的意思,还要结合对话历史,推理说话者意图、交际策略以及互动中的语用功能。在实验中,研究者选取了八个具有代表性的主流大语言模型,让这些模型同时承担两项任务:一是作为出题人编写测试题目,二是作为解题人回答这些语用推理问题。采用跨出题人(leave-writer-out)的评估模式,即模型在测试时面对的问题并非由自身编写,从而排除记忆或主题偏差,更加客观地衡量模型的真实推理能力。结果显示,这项任务对于当前最强的模型而言依然十分棘手。最佳模型在跨出题人设置下的准确率仅为81.42%,远低于人类在同等条件下90.8%的准确率。八个模型在该任务上的平均准确率只有68.70%,说明当前的通用大模型在处理中文网络评论中隐含社交语用意义时仍存在明显短板。通过错误案例分析,作者发现,模型常常能感知到某个评论带有反讽或戏谑的总体基调,但却容易混淆具体的幽默机制或互动性行为,例如无法准确区分一句评论是在嘲讽还是在自嘲,或者不清楚它是在攻击对方还是在维护群体关系。该论文在提交信息中标注了学科分类:计算与语言(cs.CL)、人工智能(cs.AI)和人机交互(cs.HC)。论文的arXiv编号为2609.04384,于2026年9月3日首次提交。此外,论文已被接收为EMNLP 2026主会论文。这一研究工作为社交媒体语用推理评测提供了新思路,也为未来改进模型的交际能力、文化敏感性和上下文理解指明了方向。随着人机交互越来越普遍,让模型掌握看懂中文网络社区中那些话里有话的表达,将成为提升自然语言理解系统的重要一环。
你真的没看懂吗?针对中文网络评论中间接与戏谑用语的社交语用推理基准测试
文章摘要
该研究提出了一个用于评估大语言模型(LLM)理解中文网络评论中间接、戏谑性社交语用含义的基准。基于逾20万条公开中文社交媒体互动记录,构建了4735个人工验证的诊断项,每项包含目标评论、重建的前置语境及合理的误读选项。在跨写作者设置下评估了8种LLM,最强模型准确率为81.42%,平均准确率仅68.70%,而人类准确率达90.8%。案例分析显示,模型常能识别宽泛的讽刺或戏谑,却难以判断具体机制或互动行为。
来源arXiv Computational Linguistics作者: Shiwei Hong, Junjie Ma, Emma Jiren Wang, Ethan Z. Rong, Siying Hu, Haichang Li, Ziying Wang, Zhicong Lu
你真的没看懂吗?针对中文网络评论中间接与戏谑用语的社交语用推理基准测试