AI News HubLIVE
站內改寫1 分鐘閱讀

為什麼語言模型比人類更不驚訝?測試解析多樣性不匹配假説

驚異性理論認為單詞的處理難度由其上下文可預測性決定,但語言模型(LM)的驚異性在花園路徑句等句法歧義研究中系統性地低估了人類遇到的困難。本研究測試了“解析多樣性不匹配假説”:LM可能比人類同時考慮更多不同的句子解釋。通過循環神經網絡文法(RNNG)和詞同步束搜索,改變用於計算單詞驚異性的同時解析數量,發現減少同時解析確實增加了預測的花園路徑效應幅度,但遠不足以捕捉人類效應的全部幅度,表明該假説無法解釋LM驚異性和人類句子處理之間的差異。

來源arXiv Computational Linguistics作者: William Timkey, Brian Dillon, Tal Linzen

2026年5月14日,一篇由William Timkey等人提交至arXiv的論文(編號2605.15440)深入探討了語言模型(LM)與人類在句子處理中驚異性(surprisal)的系統性差異。驚異性理論基於一個核心觀點:單詞在上下文中的可預測性決定了其處理難度。該理論為連接人類句子處理與LM的下一個詞預測提供了潛在橋樑。儘管LM的驚異性在自然文本的閲讀時間預測中表現出色,但在控制實驗的句法歧義研究中,尤其是在花園路徑句(如“The horse raced past the barn fell”)中,LM的驚異性卻系統性地低估了人類實際遇到的困難程度。

為了解釋這一差異,作者提出了“解析多樣性不匹配假説”(Parse Multiplicity Mismatch Hypothesis)。該假説認為,LM可能比人類在句法分析時同時保留更多不同的句子解釋,從而使得LM的驚異性偏低。如果人類受限於工作記憶只能維持少數幾種解釋,那麼LM的廣泛搜索就會導致其低估困難。為驗證這一假説,研究團隊採用了循環神經網絡文法(RNNG)結合詞同步束搜索的方法,通過調整束搜索的寬度,系統地改變計算單詞驚異性時考慮的同時解析數量。

實驗結果表明,當減少同時維護的解析數量時,LM預測的花園路徑效應幅度確實有所增加,但增加的程度遠不足以匹配人類數據中觀察到的效應大小。即使將解析數量降至極低水平,LM的驚異性仍然低估了人類的實際困難。這一發現強烈表明,LM與人類在同時解析數量上的差異並不是造成驚異性差異的主要原因。論文進一步指出,可能還有其他因素在起作用,例如人類在句法分析中受到的記憶限制、注意力機制或更復雜的認知約束,這些因素尚未被當前模型充分捕捉。

該研究不僅對計算語言學領域具有重要意義,也推動了對人類認知和LM行為的更深層次理解。它提示我們,單純調整模型架構或搜索策略可能不足以彌合LM與人類在句子理解上的鴻溝,未來研究需要探索更符合人類認知特性的建模方法。