大语言模型中的分层分级
该论文提出了一种名为分级大语言模型(GLLMs)的代数框架,通过为Transformer表示空间引入分级,并传播诱导的加权标量作用,在保持表达能力、计算复杂度和推理成本的同时,扩展了分级神经网络和分级Transformer到自回归语言模型。几何上,分级的好处由Kempf-Ness泛函表示,最优分级由两个矩映射的重合点给出,而普通Transformer作为边界上的半稳定各向同性点。此外,对于分层目标,证明了分级先验与无分级先验之间的极小极大分离。
近年来,大型语言模型(LLMs)取得了显著进展,但如何有效利用数据的层次结构仍是一个挑战。近日,一篇题为《大语言模型中的分层分级》的论文提出了一种名为分级大语言模型(GLLMs)的代数框架,旨在通过引入分级结构来提升Transformer的表达能力和效率。
该框架为Transformer的表示空间赋予一个分级,并允许这种分级通过嵌入、自注意力机制和训练目标传播。在保持模型表达能力和渐近计算复杂度的同时,GLLMs将分级神经网络和分级Transformer的理念扩展到自回归语言模型。这意味着模型可以在不增加推理成本的情况下,更好地捕捉数据中的层次结构。
从几何角度看,该工作基于几何不变量理论。分级的好处通过Kempf-Ness泛函进行度量,而最优分级可以通过两个矩映射的重合点封闭形式给出。有趣的是,普通Transformer被证明是分级族中的一个半稳定各向同性点,位于一个开放凸锥的边界上,而非一个孤立的全局最优。这一发现挑战了我们对Transformer最优性的传统认知,表明标准Transformer实际上是更大分级家族的一个特例。
对于具有层次结构的目标,论文证明了分级先验能带来显著的极小极大分离:在特定的样本量窗口内,基于分级先验的估计器风险远低于均匀模型。这种分离随着层级数量的增加呈指数级衰减,且所需的分级配置可在训练前通过离线估计解决一个凸规划得到。这为在训练前确定最优分级提供了理论保证。
由于训练后分级信息被吸收到参数中,每个GLLM可以编译为架构和推理复杂度完全相同的标准Transformer。这意味着GLLMs提供了一种无需增加推理成本即可提升性能的通用方法。作者指出,该方法不仅适用于自回归语言模型,还可以推广到其他架构。该工作为设计更高效、更适应数据结构的语言模型开辟了新方向,对于自然语言处理领域具有重要的理论价值和实践意义。未来,研究者可以基于此框架探索更复杂的分级结构,进一步提升模型在多层次任务上的表现。