跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

22,580:从GPT-2到Kimi K3,解读其发展历程

文章摘要

本文追溯了从GPT-2(1.24亿参数)到Kimi K3(2.8万亿参数)的架构演进,七年间规模增长22580倍。文章解释了关键创新,包括KV缓存、线性注意力和DeltaNet,揭示了基础机制如何演化以支撑巨大规模。

22,580:从GPT-2到Kimi K3,解读其发展历程
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

2019年,OpenAI发布的GPT-2拥有1.24亿参数,是当时最大的语言模型之一。到了2026年,Kimi K3模型参数规模达到2.8万亿,相当于在短短七年内将模型容量提升了22580倍。这种惊人的扩展不仅是规模的简单放大,更伴随着一系列架构创新。本文以Ali Taha的工作日志形式,逐步剖析从GPT-2到Kimi K3的关键技术演变。

GPT-2采用纯解码器架构:输入首先经过词嵌入和位置嵌入,然后通过12个Transformer块,每个块内含层归一化、因果自注意力和前馈网络。注意力机制中,查询、键、值通过线性投影获得,并计算缩放点积注意力,最后通过输出投影得到隐藏状态。在自回归生成时,模型仅使用最后一个位置的logits预测下一个token,但每次都需要重新计算所有先前位置的表示,效率低下。

KV缓存的引入解决了这一重复计算问题。它存储先前所有token的键值向量,避免每次生成时重新计算。然而,KV缓存随序列长度线性增长,在长序列场景下形成内存带宽瓶颈。以GPT-2为例,12层、12头、768维嵌入,KV缓存每步读取和写入的数据量随序列增长。

线性注意力试图从根本上解决KV缓存的增长问题。它将softmax注意力中的非线性(指数运算)替换为可分离的特征映射,如ELU+1。这样,查询和键分别经过映射后,键值乘积可以重新结合,使得过去所有键值对可以折叠成一个固定的D×D状态矩阵。在长序列(N远大于D)下,固定状态显著减少内存流量,但代价是特征映射的表达能力弱于softmax核,可能降低模型精度。

然而,线性注意力的纯加法更新会导致信息干扰:当序列长度超过状态容量时,旧关联与新关联叠加,无法精确检索。DeltaNet(源自快速权重编程器)通过增量更新解决此问题。它首先读取当前键在缓存中的旧值,然后仅写入实际变化部分(即新值与旧值之差)。写入强度由可学习的beta参数控制,并通过键归一化确保精确读取。这使得模型能够动态管理内存,选择性保留或删除信息,在超长序列中保持性能。

从GPT-2到Kimi K3,每一步创新都围绕着如何更高效地处理日益增长的规模和序列长度。KV缓存、线性注意力和DeltaNet代表了从“被动存储”到“主动记忆管理”的演进方向,为下一代大语言模型奠定了技术基础。

展开要点与分析

文章情报

工程师进阶

要点

  • GPT-2有1.24亿参数;Kimi K3有2.8万亿参数,增长22580倍。
  • KV缓存避免重复计算,但随序列长度线性增长。
  • 线性注意力使用固定大小状态提高效率,但特征映射表达能力较弱。
  • DeltaNet通过增量更新解决缓存干扰,仅写入新信息。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。