训练动力学:语言模型中涌现、可塑性丧失与电路控制的驱动成核速率定律
这篇arXiv论文提出,语言模型的能力涌现取决于电路各组件的“无部分信用”联合对齐,并将此建模为驱动成核过程。实验表明,等待时间取决于缺失组件数而非电路大小;在Pythia上消融单个关键组件后能力中位数仅剩17%。研究还发现,延迟学习可能永久阻止能力出现,而重新初始化query-key切片可恢复可学习性。
一项新提交至arXiv的研究(编号2607.27281,作者Lei Dong)提出,语言模型中的能力涌现并非渐进累积,而是由电路各组件的“无部分信用”联合对齐所决定:只有当最后一个关键组件也随机对齐时,能力才会出现,而只差一个组件的尝试毫无价值。作者认为这种联合对齐正是能力形成的限速步骤。论文于2026年7月29日提交,共40页、12幅图。
为了检验这一观点,研究者设计了无捷径(shortcut-free)实验装置。他们发现,一个缺少三个组件的五部分电路与一个缺少三个组件的三部分电路等待时间接近(1.19–1.37倍),说明等待时间取决于缺失组件的数量,而非电路总大小。在Pythia模型上,跨七种能力、三种规模,32/32个判别单元中,消融一个关键部分后能力中位数仅剩17%,而“部分信用”假设预测应保留50–83%(p = 2e-10);随机非关键头部则保留100%。
作者将这一过程形式化为一个速率方程:位点×尝试次数×驱动力×exp(−βK)−破坏项,其中势垒K随缺失部分数量增长。该方程以三种方式进行预注册验证(冻结常数)。正向预测:一旦混合物越过浓度下限(上限组10/10点燃,下限组0/12未点燃),原本平缓的能力会在指定步骤点燃;并且在其仍看似平坦时,可根据前体以中位5%的误差预测出现时间(六个留出模型)。反向预测:延迟学习一种被扣留的能力会让延迟成本越来越大,超过某个临界步骤后就永远无法点燃;然而验证损失始终平滑下降,标准监控手段无法察觉。研究还定位了损伤机制:注意力头部会“承诺”给基础数据。治疗方法是将query-key切片重新初始化,6/6的模型恢复可学习性,而仅重置value切片则完全无效(0/6)。
在受控的门控注意力模型中,作者证明了该机制:占据(occupation)会制造一个截止期限,且其后果无需混合假设。此外,他们发现SGD的噪声不满足涨落耗散检验,因此自行安装了一个噪声源,并可按计划对电路进行退火、熔化和固定。论文适用范围为至1.4B参数的transformer中的合取电路。