标题:语料库选择如何改变依存距离估计?
作者:陈思瑞(Sirui Chen)
提交于2026年7月6日。本文为预印本,共18页,3张图。学科:计算与语言(cs.CL)。论文编号arXiv:2609.04223。
摘要:依存距离估计通常被当作语言属性,但这一假设并未在不同独立编纂的语料库之间得到检验。我们使用一致性相关、Bland-Altman分析和十二种规格的multiverse设计,比较了Universal Dependencies v2.18中38对同语言树库的平均依存距离估计。跨树库一致性至多中等:用一个树库替代另一个,会使近40%的语言对排序颠倒,且树库选择约占组间方差的29%。这种分歧远超树库内采样误差,并且在所有十二种预处理规格下持续存在。然而,每个树库都证实了依存距离最小化(归一化比率低于1)。数据更支持MDD是受语法、语体和标注因素影响的语料库条件复合体,而非稳定的语言级参数:定性DLM普遍性在语料库替换后仍然存在,但跨语言的序数排序则不复存在。
详细说明:本文对“依存距离最小化”(DLM)这一普遍性进行了严格检验。DLM认为人类语言倾向于最小化句法依存距离,以降低工作记忆负担。然而,以往研究通常基于单一语料库(如UD treebank)计算平均依存距离(MDD),并将结果视为特定语言的固定属性。本文使用Universal Dependencies v2.18中的38对同语言树库(每对包含两个独立编译的树库),通过多种统计方法评估树库选择的影响。
方法包括:一致性相关系数(CCC)、Bland-Altman图以及十二种不同的预处理规范(multiverse分析)。结果显示,树库之间的协议程度仅为中等:某一语言在树库A中的MDD排名与在树库B中的排名可能发生显著变化,具体来说,39.6%(近40%)的语言对排序会因树库选择而翻转。此外,树库选择解释了约29%的语言间方差,这意味着如果只使用一个树库,约三分之一的差异可能是由语料库本身造成的,而非语言差异。
重要的是,这种变异远大于同一树库内不同样本导致的采样误差。换句话说,观察到的分歧不是随机噪声,而是系统性的树库效应。而且,这种效应在十二种不同预处理条件(例如不同的句子分割、词形还原、停用词处理等)下都稳定存在,表明结果不是特定预处理步骤的产物。
尽管如此,研究者发现一个一致的模式:在所有被检查的树库中,依存距离最小化都得到支持,即归一化的依存距离比(通常是实际MDD与基线随机词序MDD的比值)小于1。这意味着,尽管具体的MDD数值和语言排序高度依赖于语料库选择,但语言确实倾向于短距离依存的定性结论是稳健的。
因此,作者认为平均依存距离(MDD)不应被视为语言的固定参数,而是一个依赖于语料库的复合度量,反映了语法规则、文本语域(如口语与书面语)以及标注方案等多种因素的组合。该研究强调了在跨语言比较中使用多个语料库的重要性,并表明基于单一语料库得出的跨语言排序可能并不可靠。
引用信息:arXiv:2609.04223v1 [cs.CL],DOI: 10.48550/arXiv.2609.04223。提交历史:v1于2026年7月6日13:53:13 UTC。