编码脑电信号探究语言模型中类似人类的下一词预测行为
该研究通过脑电图记录的事件相关电位(ERP),对比人类与语言模型在下一词预测任务中的表现,发现仅信息论中的“惊奇度”指标与语言处理的ERP相关,尤其是对于语义丰富的高内容词,而模型规模扩大并不必然带来更类人的认知处理。
语言模型(LMs)通过训练能够根据上下文精准预测下一个词,而人类在阅读理解中也表现出类似的预测能力。神经科学研究早已揭示,下一词的可预测性会影响大脑的实时反应,这种反应可以通过脑电图(EEG)以毫秒级分辨率记录下来。尽管当前先进的语言模型在下一词预测任务上的准确度已经与人类表现高度吻合,但这引发了一个关键问题:更高的预测准确度是否真正意味着这些模型捕捉到了与人类阅读理解相关的认知信号?为了探究这一问题,研究团队为人类受试者和多种语言模型生成了基于两种信息度量——顶部预测(top-1 prediction)和惊奇度(surprisal)——的回归变量,用以预测从EEG记录中提取的事件相关电位(ERP)。ERP反映了阅读过程中不同阶段的认知处理,对ERP模式的建模能够为评估语言模型在阅读时的认知合理性提供细粒度的分析。实验结果表明,只有惊奇度指标与语言处理中的ERP存在潜在关联,尤其是在那些语义内容丰富的开放类词汇上。这一发现对当前人工智能领域的一个普遍假设提出了挑战,即通过增加模型参数和计算预算来扩展语言模型规模,会持续改善其与人类语言处理的一致性。换句话说,单纯追求更大的模型并不必然带来更类人的认知处理方式。该研究提示,未来的语言模型发展应当更多地关注认知机制的对齐,而非仅仅提升预测准确度。