为什么语言模型比人类更不惊讶?测试解析多样性不匹配假说
惊异性理论认为单词的处理难度由其上下文可预测性决定,但语言模型(LM)的惊异性在花园路径句等句法歧义研究中系统性地低估了人类遇到的困难。本研究测试了“解析多样性不匹配假说”:LM可能比人类同时考虑更多不同的句子解释。通过循环神经网络文法(RNNG)和词同步束搜索,改变用于计算单词惊异性的同时解析数量,发现减少同时解析确实增加了预测的花园路径效应幅度,但远不足以捕捉人类效应的全部幅度,表明该假说无法解释LM惊异性和人类句子处理之间的差异。
2026年5月14日,一篇由William Timkey等人提交至arXiv的论文(编号2605.15440)深入探讨了语言模型(LM)与人类在句子处理中惊异性(surprisal)的系统性差异。惊异性理论基于一个核心观点:单词在上下文中的可预测性决定了其处理难度。该理论为连接人类句子处理与LM的下一个词预测提供了潜在桥梁。尽管LM的惊异性在自然文本的阅读时间预测中表现出色,但在控制实验的句法歧义研究中,尤其是在花园路径句(如“The horse raced past the barn fell”)中,LM的惊异性却系统性地低估了人类实际遇到的困难程度。
为了解释这一差异,作者提出了“解析多样性不匹配假说”(Parse Multiplicity Mismatch Hypothesis)。该假说认为,LM可能比人类在句法分析时同时保留更多不同的句子解释,从而使得LM的惊异性偏低。如果人类受限于工作记忆只能维持少数几种解释,那么LM的广泛搜索就会导致其低估困难。为验证这一假说,研究团队采用了循环神经网络文法(RNNG)结合词同步束搜索的方法,通过调整束搜索的宽度,系统地改变计算单词惊异性时考虑的同时解析数量。
实验结果表明,当减少同时维护的解析数量时,LM预测的花园路径效应幅度确实有所增加,但增加的程度远不足以匹配人类数据中观察到的效应大小。即使将解析数量降至极低水平,LM的惊异性仍然低估了人类的实际困难。这一发现强烈表明,LM与人类在同时解析数量上的差异并不是造成惊异性差异的主要原因。论文进一步指出,可能还有其他因素在起作用,例如人类在句法分析中受到的记忆限制、注意力机制或更复杂的认知约束,这些因素尚未被当前模型充分捕捉。
该研究不仅对计算语言学领域具有重要意义,也推动了对人类认知和LM行为的更深层次理解。它提示我们,单纯调整模型架构或搜索策略可能不足以弥合LM与人类在句子理解上的鸿沟,未来研究需要探索更符合人类认知特性的建模方法。