AI News HubLIVE
站内改写2 分钟阅读

算术启发式神经元是否具有形式不变性?对LLM中符号、文本和代码的机制分析

本研究通过机制可解释性方法,分析Llama-3模型在符号算术、自然语言应用题和Python代码三种形式下的算术计算机制,发现一组紧凑的共享神经元在三种形式中均被激活,且跨格式失败源于激活状态而非不同电路,表明LLM的算术计算在神经元层面具有形式不变性。

来源arXiv Computational Linguistics作者: Sharath Naganna, Tanvir Ahmed Sijan, Uddipta Kalita

大型语言模型(LLM)在一种问题表述上成功,但在等价表述上失败的现象引发了对其内部计算机制的深入探究。例如,一个模型可能正确回答“25+37等于多少?”却无法解决“小明有25个苹果,小红有37个苹果,他们一共有多少个苹果?”这类自然语言问题。长期以来,研究人员对这类跨格式失败的根本原因存在争议:是模型使用了完全不同的内部电路,还是同一共享电路在不同输入形式下处于不同的激活状态?

近期机制可解释性研究表明,LLM中的算术计算源于一组稀疏的MLP神经元编码的“启发式包”,这些神经元代表不同的算术策略,如进位法、分解法等。然而,这些启发式神经元是否在不同问题形式中具有形式不变性,仍是一个开放问题。

本研究由Sharath Naganna等人开展,对Llama-3系列模型(包括不同规模)进行了系统分析。他们采用归因修补和激活修补相结合的两阶段管道,识别出每种形式下的算术启发式神经元。首先,通过归因修补定位对算术输出贡献最大的神经元;然后,通过激活修补验证这些神经元的功能必要性。实验发现,存在一组紧凑的神经元集在符号算术(如“25+37”)、自然语言应用题(如上述苹果问题)和Python代码(如“print(25+37)”)三种形式中均被激活。

通过靶向干预,研究人员证实该共享电路对于后层的算术计算既是必要的也是充分的。进一步实验显示,将共享神经元在一种形式成功执行时的激活状态转移到另一种形式的失败执行中,能够恢复大部分错误预测——加法与减法的恢复率超过97%。这一结果表明,跨格式失败并非源于不同的内部电路,而是同一共享电路在不同激活状态下的表现。此外,共享神经元在三种形式中始终属于相同的启发式家族,进一步证实了LLM算术计算在神经元层面的形式不变性。

该研究的发现具有重要意义。首先,它揭示了LLM在处理不同形式的算术问题时,底层机制具有高度的一致性,这为理解模型的泛化能力提供了新的视角。其次,它表明模型在一种形式上的失败可以通过调整共享神经元的激活状态来纠正,这为提升模型鲁棒性提供了潜在方法。例如,可以通过干预特定神经元的激活来改善模型在自然语言任务上的算术表现。该研究也为未来探索其他认知能力(如推理、规划)的跨格式不变性奠定了基础。