AI News HubLIVE
站內改寫2 分鐘閱讀

訓練動力學:語言模型中湧現、可塑性喪失與電路控制的驅動成核速率定律

這篇arXiv論文提出,語言模型的能力湧現取決於電路各元件的“無部分信用”聯合對齊,並將此建模為驅動成核過程。實驗表明,等待時間取決於缺失元件數而非電路大小;在Pythia上消融單個關鍵元件後能力中位數僅剩17%。研究還發現,延遲學習可能永久阻止能力出現,而重新初始化query-key切片可恢復可學習性。

來源arXiv Machine Learning作者: Lei Dong

一項新提交至arXiv的研究(編號2607.27281,作者Lei Dong)提出,語言模型中的能力湧現並非漸進累積,而是由電路各元件的“無部分信用”聯合對齊所決定:只有當最後一個關鍵元件也隨機對齊時,能力才會出現,而只差一個元件的嘗試毫無價值。作者認為這種聯合對齊正是能力形成的限速步驟。論文於2026年7月29日提交,共40頁、12幅圖。

為了檢驗這一觀點,研究者設計了無捷徑(shortcut-free)實驗裝置。他們發現,一個缺少三個元件的五部分電路與一個缺少三個元件的三部分電路等待時間接近(1.19–1.37倍),說明等待時間取決於缺失元件的數量,而非電路總大小。在Pythia模型上,跨七種能力、三種規模,32/32個判別單元中,消融一個關鍵部分後能力中位數僅剩17%,而“部分信用”假設預測應保留50–83%(p = 2e-10);隨機非關鍵頭部則保留100%。

作者將這一過程形式化為一個速率方程:位點×嘗試次數×驅動力×exp(−βK)−破壞項,其中勢壘K隨缺失部分數量增長。該方程以三種方式進行預註冊驗證(凍結常數)。正向預測:一旦混合物越過濃度下限(上限組10/10點燃,下限組0/12未點燃),原本平緩的能力會在指定步驟點燃;並且在其仍看似平坦時,可根據前體以中位5%的誤差預測出現時間(六個留出模型)。反向預測:延遲學習一種被扣留的能力會讓延遲成本越來越大,超過某個臨界步驟後就永遠無法點燃;然而驗證損失始終平滑下降,標準監控手段無法察覺。研究還定位了損傷機制:注意力頭部會“承諾”給基礎資料。治療方法是將query-key切片重新初始化,6/6的模型恢復可學習性,而僅重置value切片則完全無效(0/6)。

在受控的門控注意力模型中,作者證明了該機制:佔據(occupation)會製造一個截止期限,且其後果無需混合假設。此外,他們發現SGD的噪聲不滿足漲落耗散檢驗,因此自行安裝了一個噪聲源,並可按計劃對電路進行退火、熔化和固定。論文適用範圍為至1.4B引數的transformer中的合取電路。