編碼腦電訊號探究語言模型中類似人類的下一詞預測行為
該研究透過腦電圖記錄的事件相關電位(ERP),對比人類與語言模型在下一詞預測任務中的表現,發現僅資訊理論中的“驚奇度”指標與語言處理的ERP相關,尤其是對於語義豐富的高內容詞,而模型規模擴大並不必然帶來更類人的認知處理。
語言模型(LMs)透過訓練能夠根據上下文精準預測下一個詞,而人類在閱讀理解中也表現出類似的預測能力。神經科學研究早已揭示,下一詞的可預測性會影響大腦的即時反應,這種反應可以透過腦電圖(EEG)以毫秒級解析度記錄下來。儘管當前先進的語言模型在下一詞預測任務上的準確度已經與人類表現高度吻合,但這引發了一個關鍵問題:更高的預測準確度是否真正意味著這些模型捕捉到了與人類閱讀理解相關的認知訊號?為了探究這一問題,研究團隊為人類受試者和多種語言模型生成了基於兩種資訊度量——頂部預測(top-1 prediction)和驚奇度(surprisal)——的迴歸變數,用以預測從EEG記錄中提取的事件相關電位(ERP)。ERP反映了閱讀過程中不同階段的認知處理,對ERP模式的建模能夠為評估語言模型在閱讀時的認知合理性提供細粒度的分析。實驗結果表明,只有驚奇度指標與語言處理中的ERP存在潛在關聯,尤其是在那些語義內容豐富的開放類詞彙上。這一發現對當前人工智慧領域的一個普遍假設提出了挑戰,即透過增加模型引數和計算預算來擴充套件語言模型規模,會持續改善其與人類語言處理的一致性。換句話說,單純追求更大的模型並不必然帶來更類人的認知處理方式。該研究提示,未來的語言模型發展應當更多地關注認知機制的對齊,而非僅僅提升預測準確度。