AI News HubLIVE
站內改寫2 分鐘閱讀

VakyArth:評測大語言模型在印度語言中的語用能力

研究團隊推出 VakyArth,這是首個面向印度語言的語用能力評測基準,覆蓋印地語、旁遮普語、泰米爾語和馬拉雅拉姆語,並使用選擇題、自然語言推理和翻譯三類任務評估五種語用現象。結果顯示,多語言大模型在依賴印度語言與文化慣例的語用理解上普遍失敗,且自動翻譯指標可能掩蓋流暢但語用不忠實的輸出。

來源arXiv Computational Linguistics作者: Usneek Singh, Poorvaja Veera Balaji Kumar, Parth Nanda, Anand Madhusoodanan, Geyang Guo, Wei Xu, Junyi Jessy L

真實世界中的交流並不只靠字面語義:聽者和讀者需要根據上下文與文化慣例,識別暗示、意圖和言外之意,這種能力被稱為語用推理。現有的語用評測大多以英語及少數高資源語言為對象,印度語言雖然承載着豐富的語言與文化多樣性,卻長期缺乏系統性評測。為了彌合這一空白,Usneek Singh 等七位研究者提出了 VakyArth,據稱是第一個用於印度語言的語用學診斷基準,相關論文已被 EMNLP 2026 Findings 接收。

VakyArth 選取印地語、旁遮普語、泰米爾語和馬拉雅拉姆語四種語言,覆蓋五個語用現象:指示語,即代詞和時空表達如何依賴語境確定所指;言語行為,即如何用話語完成請求、道歉、許諾等動作;含意,即領會字面之外的意思;社會語用,即如何根據權力、親疏和禮貌規範選擇表達;以及篇章連貫,即如何讓語篇在語境中自然銜接。基準通過選擇題、自然語言推理和翻譯三類任務進行評測,所有題項均由母語者編寫,以便探測真實的語用規範。

研究者在多種族系和規模的多語言大語言模型上進行了系統實驗,結果並不樂觀:模型在理解和推理這些植根於印度語言與文化慣例的語用含義時,表現出一致性缺陷。分析還發現若干系統性差異。在研究者考察的所有模型—語言組合中,選擇題準確率均高於自然語言推理準確率,説明任務形式會影響模型顯現出的語用能力;同時,模型的翻譯表現並不能可靠地對應其語用理解水平,説明一個系統可能在翻譯任務上看起來不錯,卻未必真正掌握語用含義。

另一個顯著現象是語言系屬帶來的差異:在翻譯任務上,印歐語系下的印度-雅利安語支語言,如印地語和旁遮普語,普遍優於達羅毗荼語系語言,如泰米爾語和馬拉雅拉姆語。這或許與訓練數據分佈等資源因素有關,但也意味着針對印度語言的語用能力評估不能僅依賴翻譯成績。論文特別指出,常見的自動翻譯指標可能把輸出評為流暢或高質量,卻漏掉語用上不忠實的語義;這種風險在含意和指示語相關表達中尤其明顯。

VakyArth 的意義在於為印度語言的大模型評估提供了多維度診斷工具。論文於2026年9月1日提交至 arXiv,編號為2609.01788。通過覆蓋語言與文化習俗的題項設計,VakyArth 提醒研究者:真正多語言、多文化的語言智能,不只是掌握詞彙和語法,更需要理解人在什麼語境裏、為什麼這樣説。