人類語言中上下文持續性的標度律
研究發現人類語言中單詞序列的上下文影響遵循近似於1/d的冪律衰減,指數接近1,該規律在十種不同語系語料庫中一致出現,且在打亂順序或合成文本中消失。
一篇新研究揭示了人類語言中單詞序列組織背後的基本規律,表明上下文對單詞理解的影響隨着距離增加而遵循簡單的冪律衰減。該研究由埃爾安·巴倫霍爾茨(Elan Barenholtz)完成,於2026年7月28日提交至預印本平台arXiv(編號:2607.25184),目前尚未經過同行評審。
過去,語言學家已經發現了詞彙層面(詞頻、詞彙增長)和詞對層面(跨距離共現)的規律性結構。本研究進一步考察了單詞排列順序對意義的影響,這是語言理解的核心。研究者利用大型語言模型(LLM)作為概率探針,測量了在距離d處的先前上下文對目標詞困惑度的降低程度,並與相同單詞打亂順序後的情況進行了比較。這種差異,稱為“上下文持續性函數”P(d),專門捕捉了單詞排列順序的影響。
實驗覆蓋了10個不同語料庫,涉及6個語系(包括印歐語系、漢藏語系、尼羅-撒哈拉語系等),同時涵蓋了書面語和口語模態。結果令人驚訝地一致:P(d)近似按照1/d的冪律衰減,即P(d) ∝ d^{-α},其中α的平均值為1.04,中位數擬合優度r²達到0.96。這種規律在打亂順序的文本和人工合成的對照文本中消失,而且在獨立的不同LLM探針(包括GPT-2和BERT)中均可復現。此外,同樣的分析方法應用於基因組和蛋白質序列時,使用領域原生模型並未觀察到類似的衰減模式,這表明該規律可能為人類語言所獨有。
研究者指出,指數接近1意味着上下文的影響在對數時間尺度上幾乎均勻分佈:無論距離是近還是遠,每個對數間隔內的總影響大致相等。這類似於許多自然現象中的1/f噪聲。該發現為人類語言中句法結構的統計規律提供了新的標度律,可能對自然語言處理和認知科學產生深遠影響。例如,它可能幫助改進語言模型的上下文窗口設計,或者為理解語言處理中的記憶機制提供線索。
論文共21頁,包含5張主圖及1張補充圖,補充材料另附。作者還提供了源代碼和數據以促進可重複性。該研究目前僅以預印本形式發佈,尚未經過同行評審,但因其跨語言、跨模態的一致性而備受關注。