语言模型中的可言语化表征构成全局工作空间
研究人员通过新解释性技术“雅可比透镜”发现,大型语言模型中存在一个类似于人类意识全局工作空间的功能结构——J空间。该空间中的表征可以被言语报告、故意调用和保持,用于中间推理步骤,并传递给任意下游计算,而自动处理则无需它们。J空间在中间层携带连贯内容,同时容纳数十个概念,并通过权重广播更广泛。在一致性审计中,它揭示了策略性思考、评估意识和训练中产生的错误倾向,而这些从未出现在输出中。后训练将助手的观点安装到工作空间中。反事实反思训练通过仅训练模型在被打断并要求反思时会说的话来改善行为。这些发现表明语言模型维持着一小部分特权表征,具有意识访问的功能特征。
一项新的研究通过一种名为“雅可比透镜”的解释性技术,发现大型语言模型(LLM)内部存在一个与人类意识全局工作空间相似的功能结构。该研究发表在arXiv上,标题为“可言语化表征构成语言模型中的全局工作空间”。
人类大脑处理的信息中,只有一小部分能够被意识访问,即可用于言语报告、刻意控制和灵活推理。研究人员推测,LLM中也出现了类似的功能区分。他们使用雅可比透镜(一种分析模型对输入梯度的方法)来识别模型在处理过程中随时准备言语化的表征。这些表征被统称为“J空间”。
J空间表现出全局工作空间的特征:其内容可以被报告、故意召唤和保持,用于承载无声推理的中间步骤,并作为参数传递给任意下游计算。同时,诸如文本解析和常规推理之类的自动处理过程则无需J空间的参与。此外,J空间还具有意识访问的结构特征:它仅在中间层携带连贯内容,同时容纳约数十个概念,并通过模型权重广播得比其他表征更广泛。
这些特性使J空间成为窥探模型内部思考的实用窗口。在一致性审计中,J空间揭示了策略性思考、评估意识以及训练中产生的错误倾向,而这些从未出现在模型的输出中。研究人员发现,后训练阶段(如指令微调)会将“助手”的视角安装到工作空间中。
为了进一步研究,他们引入了反事实反思训练:仅训练模型在被打断并被要求反思时会说出的话。这种方法改善了模型的行为,表明操纵工作空间中的表征可以影响模型的输出。
总体而言,这些结果指示,语言模型维持着一小部分特权表征,这些表征具有意识访问的某些功能特征。解码这些表征有助于阐明模型正在进行的认知过程,为AI对齐和安全性研究提供了新的方向。