AI News HubLIVE
站内改写2 分钟阅读

22,580:从GPT-2到Kimi K3,解读其发展历程

本文追溯了从GPT-2(1.24亿参数)到Kimi K3(2.8万亿参数)的架构演进,七年间规模增长22580倍。文章解释了关键创新,包括KV缓存、线性注意力和DeltaNet,揭示了基础机制如何演化以支撑巨大规模。

2019年,OpenAI发布的GPT-2拥有1.24亿参数,是当时最大的语言模型之一。到了2026年,Kimi K3模型参数规模达到2.8万亿,相当于在短短七年内将模型容量提升了22580倍。这种惊人的扩展不仅是规模的简单放大,更伴随着一系列架构创新。本文以Ali Taha的工作日志形式,逐步剖析从GPT-2到Kimi K3的关键技术演变。

GPT-2采用纯解码器架构:输入首先经过词嵌入和位置嵌入,然后通过12个Transformer块,每个块内含层归一化、因果自注意力和前馈网络。注意力机制中,查询、键、值通过线性投影获得,并计算缩放点积注意力,最后通过输出投影得到隐藏状态。在自回归生成时,模型仅使用最后一个位置的logits预测下一个token,但每次都需要重新计算所有先前位置的表示,效率低下。

KV缓存的引入解决了这一重复计算问题。它存储先前所有token的键值向量,避免每次生成时重新计算。然而,KV缓存随序列长度线性增长,在长序列场景下形成内存带宽瓶颈。以GPT-2为例,12层、12头、768维嵌入,KV缓存每步读取和写入的数据量随序列增长。

线性注意力试图从根本上解决KV缓存的增长问题。它将softmax注意力中的非线性(指数运算)替换为可分离的特征映射,如ELU+1。这样,查询和键分别经过映射后,键值乘积可以重新结合,使得过去所有键值对可以折叠成一个固定的D×D状态矩阵。在长序列(N远大于D)下,固定状态显著减少内存流量,但代价是特征映射的表达能力弱于softmax核,可能降低模型精度。

然而,线性注意力的纯加法更新会导致信息干扰:当序列长度超过状态容量时,旧关联与新关联叠加,无法精确检索。DeltaNet(源自快速权重编程器)通过增量更新解决此问题。它首先读取当前键在缓存中的旧值,然后仅写入实际变化部分(即新值与旧值之差)。写入强度由可学习的beta参数控制,并通过键归一化确保精确读取。这使得模型能够动态管理内存,选择性保留或删除信息,在超长序列中保持性能。

从GPT-2到Kimi K3,每一步创新都围绕着如何更高效地处理日益增长的规模和序列长度。KV缓存、线性注意力和DeltaNet代表了从“被动存储”到“主动记忆管理”的演进方向,为下一代大语言模型奠定了技术基础。