VakyArth:评测大语言模型在印度语言中的语用能力
研究团队推出 VakyArth,这是首个面向印度语言的语用能力评测基准,覆盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语,并使用选择题、自然语言推理和翻译三类任务评估五种语用现象。结果显示,多语言大模型在依赖印度语言与文化惯例的语用理解上普遍失败,且自动翻译指标可能掩盖流畅但语用不忠实的输出。
真实世界中的交流并不只靠字面语义:听者和读者需要根据上下文与文化惯例,识别暗示、意图和言外之意,这种能力被称为语用推理。现有的语用评测大多以英语及少数高资源语言为对象,印度语言虽然承载着丰富的语言与文化多样性,却长期缺乏系统性评测。为了弥合这一空白,Usneek Singh 等七位研究者提出了 VakyArth,据称是第一个用于印度语言的语用学诊断基准,相关论文已被 EMNLP 2026 Findings 接收。
VakyArth 选取印地语、旁遮普语、泰米尔语和马拉雅拉姆语四种语言,覆盖五个语用现象:指示语,即代词和时空表达如何依赖语境确定所指;言语行为,即如何用话语完成请求、道歉、许诺等动作;含意,即领会字面之外的意思;社会语用,即如何根据权力、亲疏和礼貌规范选择表达;以及篇章连贯,即如何让语篇在语境中自然衔接。基准通过选择题、自然语言推理和翻译三类任务进行评测,所有题项均由母语者编写,以便探测真实的语用规范。
研究者在多种族系和规模的多语言大语言模型上进行了系统实验,结果并不乐观:模型在理解和推理这些植根于印度语言与文化惯例的语用含义时,表现出一致性缺陷。分析还发现若干系统性差异。在研究者考察的所有模型—语言组合中,选择题准确率均高于自然语言推理准确率,说明任务形式会影响模型显现出的语用能力;同时,模型的翻译表现并不能可靠地对应其语用理解水平,说明一个系统可能在翻译任务上看起来不错,却未必真正掌握语用含义。
另一个显著现象是语言系属带来的差异:在翻译任务上,印欧语系下的印度-雅利安语支语言,如印地语和旁遮普语,普遍优于达罗毗荼语系语言,如泰米尔语和马拉雅拉姆语。这或许与训练数据分布等资源因素有关,但也意味着针对印度语言的语用能力评估不能仅依赖翻译成绩。论文特别指出,常见的自动翻译指标可能把输出评为流畅或高质量,却漏掉语用上不忠实的语义;这种风险在含意和指示语相关表达中尤其明显。
VakyArth 的意义在于为印度语言的大模型评估提供了多维度诊断工具。论文于2026年9月1日提交至 arXiv,编号为2609.01788。通过覆盖语言与文化习俗的题项设计,VakyArth 提醒研究者:真正多语言、多文化的语言智能,不只是掌握词汇和语法,更需要理解人在什么语境里、为什么这样说。