AI News HubLIVE
站内改写2 分钟阅读

人类语言中上下文持续性的标度律

研究发现人类语言中单词序列的上下文影响遵循近似于1/d的幂律衰减,指数接近1,该规律在十种不同语系语料库中一致出现,且在打乱顺序或合成文本中消失。

来源arXiv Computational Linguistics作者: Elan Barenholtz

一篇新研究揭示了人类语言中单词序列组织背后的基本规律,表明上下文对单词理解的影响随着距离增加而遵循简单的幂律衰减。该研究由埃尔安·巴伦霍尔茨(Elan Barenholtz)完成,于2026年7月28日提交至预印本平台arXiv(编号:2607.25184),目前尚未经过同行评审。

过去,语言学家已经发现了词汇层面(词频、词汇增长)和词对层面(跨距离共现)的规律性结构。本研究进一步考察了单词排列顺序对意义的影响,这是语言理解的核心。研究者利用大型语言模型(LLM)作为概率探针,测量了在距离d处的先前上下文对目标词困惑度的降低程度,并与相同单词打乱顺序后的情况进行了比较。这种差异,称为“上下文持续性函数”P(d),专门捕捉了单词排列顺序的影响。

实验覆盖了10个不同语料库,涉及6个语系(包括印欧语系、汉藏语系、尼罗-撒哈拉语系等),同时涵盖了书面语和口语模态。结果令人惊讶地一致:P(d)近似按照1/d的幂律衰减,即P(d) ∝ d^{-α},其中α的平均值为1.04,中位数拟合优度r²达到0.96。这种规律在打乱顺序的文本和人工合成的对照文本中消失,而且在独立的不同LLM探针(包括GPT-2和BERT)中均可复现。此外,同样的分析方法应用于基因组和蛋白质序列时,使用领域原生模型并未观察到类似的衰减模式,这表明该规律可能为人类语言所独有。

研究者指出,指数接近1意味着上下文的影响在对数时间尺度上几乎均匀分布:无论距离是近还是远,每个对数间隔内的总影响大致相等。这类似于许多自然现象中的1/f噪声。该发现为人类语言中句法结构的统计规律提供了新的标度律,可能对自然语言处理和认知科学产生深远影响。例如,它可能帮助改进语言模型的上下文窗口设计,或者为理解语言处理中的记忆机制提供线索。

论文共21页,包含5张主图及1张补充图,补充材料另附。作者还提供了源代码和数据以促进可重复性。该研究目前仅以预印本形式发布,尚未经过同行评审,但因其跨语言、跨模态的一致性而备受关注。