標題:語料庫選擇如何改變依存距離估計?
作者:陳思瑞(Sirui Chen)
提交於2026年7月6日。本文為預印本,共18頁,3張圖。學科:計算與語言(cs.CL)。論文編號arXiv:2609.04223。
摘要:依存距離估計通常被當作語言屬性,但這一假設並未在不同獨立編纂的語料庫之間得到檢驗。我們使用一致性相關、Bland-Altman分析和十二種規格的multiverse設計,比較了Universal Dependencies v2.18中38對同語言樹庫的平均依存距離估計。跨樹庫一致性至多中等:用一個樹庫替代另一個,會使近40%的語言對排序顛倒,且樹庫選擇約佔組間方差的29%。這種分歧遠超樹庫內取樣誤差,並且在所有十二種預處理規格下持續存在。然而,每個樹庫都證實了依存距離最小化(歸一化比率低於1)。資料更支援MDD是受語法、語體和標註因素影響的語料庫條件複合體,而非穩定的語言級引數:定性DLM普遍性在語料庫替換後仍然存在,但跨語言的序數排序則不復存在。
詳細說明:本文對“依存距離最小化”(DLM)這一普遍性進行了嚴格檢驗。DLM認為人類語言傾向於最小化句法依存距離,以降低工作記憶負擔。然而,以往研究通常基於單一語料庫(如UD treebank)計算平均依存距離(MDD),並將結果視為特定語言的固定屬性。本文使用Universal Dependencies v2.18中的38對同語言樹庫(每對包含兩個獨立編譯的樹庫),透過多種統計方法評估樹庫選擇的影響。
方法包括:一致性相關係數(CCC)、Bland-Altman圖以及十二種不同的預處理規範(multiverse分析)。結果顯示,樹庫之間的協議程度僅為中等:某一語言在樹庫A中的MDD排名與在樹庫B中的排名可能發生顯著變化,具體來說,39.6%(近40%)的語言對排序會因樹庫選擇而翻轉。此外,樹庫選擇解釋了約29%的語言間方差,這意味著如果只使用一個樹庫,約三分之一的差異可能是由語料庫本身造成的,而非語言差異。
重要的是,這種變異遠大於同一樹庫內不同樣本導致的取樣誤差。換句話說,觀察到的分歧不是隨機噪聲,而是系統性的樹庫效應。而且,這種效應在十二種不同預處理條件(例如不同的句子分割、詞形還原、停用詞處理等)下都穩定存在,表明結果不是特定預處理步驟的產物。
儘管如此,研究者發現一個一致的模式:在所有被檢查的樹庫中,依存距離最小化都得到支援,即歸一化的依存距離比(通常是實際MDD與基線隨機詞序MDD的比值)小於1。這意味著,儘管具體的MDD數值和語言排序高度依賴於語料庫選擇,但語言確實傾向於短距離依存的定性結論是穩健的。
因此,作者認為平均依存距離(MDD)不應被視為語言的固定引數,而是一個依賴於語料庫的複合度量,反映了語法規則、文本語域(如口語與書面語)以及標註方案等多種因素的組合。該研究強調了在跨語言比較中使用多個語料庫的重要性,並表明基於單一語料庫得出的跨語言排序可能並不可靠。
引用資訊:arXiv:2609.04223v1 [cs.CL],DOI: 10.48550/arXiv.2609.04223。提交歷史:v1於2026年7月6日13:53:13 UTC。