跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

你真的沒看懂嗎?針對中文網絡評論中間接與戲謔用語的社交語用推理基準測試

文章摘要

該研究提出了一個用於評估大語言模型(LLM)理解中文網絡評論中間接、戲謔性社交語用含義的基準。基於逾20萬條公開中文社交媒體互動記錄,構建了4735個人工驗證的診斷項,每項包含目標評論、重建的前置語境及合理的誤讀選項。在跨寫作者設置下評估了8種LLM,最強模型準確率為81.42%,平均準確率僅68.70%,而人類準確率達90.8%。案例分析顯示,模型常能識別寬泛的諷刺或戲謔,卻難以判斷具體機制或互動行為。

來源arXiv Computational Linguistics作者: Shiwei Hong, Junjie Ma, Emma Jiren Wang, Ethan Z. Rong, Siying Hu, Haichang Li, Ziying Wang, Zhicong Lu
你真的沒看懂嗎?針對中文網絡評論中間接與戲謔用語的社交語用推理基準測試
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在自然語言處理領域,理解語言的表層含義之外,模型還需要掌握社交語境中的言外之意。一篇題為《你真的沒看懂嗎?——中文網絡評論間接與戲謔用語的社交語用推理基準測試》的論文,近期在arXiv平台上發佈,並已被2026年自然語言處理實證方法會議(EMNLP 2026)主會接收。該研究由史偉宏(Shiwei Hong)與另外七位作者共同完成,主要關注中文社交媒體評論中普遍存在但難以處理的間接、戲謔表達。研究者指出,中文網絡評論經常通過反諷、誇張、隱喻、反話等手法傳遞社交意義,這類表達高度依賴上下文,真實交流中的互動語境對於解讀至關重要。然而,現有評測體系往往按照預設的語言現象或受控的語用分類安排測試項目,這並不能真實反映模型是否能夠理解一段自然出現的評論在具體對話互動中實際發揮的作用。為了彌補這一空缺,他們設計了一個全新的基準測試。該基準測試的構建過程十分嚴謹。首先,研究團隊收集了超過二十萬條公開的中文社交媒體互動記錄,從中篩選並重構出帶有前文語境的評論片段。他們為每條目標評論設計了可能被誤讀的干擾選項,最終構建了4735個經過人工驗證的診斷條目。每個條目都包含一條目標評論、重構出的對話前文,以及若干合理但錯誤的解讀選項。這樣的設計使模型不僅需要判斷句子本身的意思,還要結合對話歷史,推理説話者意圖、交際策略以及互動中的語用功能。在實驗中,研究者選取了八個具有代表性的主流大語言模型,讓這些模型同時承擔兩項任務:一是作為出題人編寫測試題目,二是作為解題人回答這些語用推理問題。採用跨出題人(leave-writer-out)的評估模式,即模型在測試時面對的問題並非由自身編寫,從而排除記憶或主題偏差,更加客觀地衡量模型的真實推理能力。結果顯示,這項任務對於當前最強的模型而言依然十分棘手。最佳模型在跨出題人設置下的準確率僅為81.42%,遠低於人類在同等條件下90.8%的準確率。八個模型在該任務上的平均準確率只有68.70%,説明當前的通用大模型在處理中文網絡評論中隱含社交語用意義時仍存在明顯短板。通過錯誤案例分析,作者發現,模型常常能感知到某個評論帶有反諷或戲謔的總體基調,但卻容易混淆具體的幽默機制或互動性行為,例如無法準確區分一句評論是在嘲諷還是在自嘲,或者不清楚它是在攻擊對方還是在維護羣體關係。該論文在提交信息中標註了學科分類:計算與語言(cs.CL)、人工智能(cs.AI)和人機交互(cs.HC)。論文的arXiv編號為2609.04384,於2026年9月3日首次提交。此外,論文已被接收為EMNLP 2026主會論文。這一研究工作為社交媒體語用推理評測提供了新思路,也為未來改進模型的交際能力、文化敏感性和上下文理解指明瞭方向。隨着人機交互越來越普遍,讓模型掌握看懂中文網絡社區中那些話裏有話的表達,將成為提升自然語言理解系統的重要一環。

展開要點與分析

文章情報

投資人進階

要點

  • 構建了包含4735個人工驗證項的中文社交語用推理基準,每項包含語境與合理誤讀。
  • 8種LLM在跨寫作者設置下的平均準確率為68.70%,最強模型為81.42%,人類為90.8%。
  • 模型往往識別出諷刺或戲謔,但會誤解其具體機制或互動意圖。
  • 論文已被EMNLP 2026主會接收,預印本編號arXiv:2609.04384。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。