AI News HubLIVE
站内改写2 分钟阅读

循环变压器中的自适应深度:诊断学习暂停门与轨迹读取

该研究通过轨迹-读取视角分析循环变压器的自适应深度问题,发现固定先验深度监督能产生难度感知轨迹,且简单的后验置信度读取器常优于学习门控。实验表明,联合门训练导致的轨迹问题是性能瓶颈,而非门控表达能力不足。

来源arXiv Machine Learning作者: Andrei Cristian Popescu, Haitz S\'aez de Oc\'ariz Borde, Pietro Li\`o

近日,arXiv上发布了一项关于循环变压器(Looped Transformers)自适应深度的重要研究,论文编号为2607.20519。该研究由Andrei Cristian Popescu等人完成,系统诊断了循环变压器中学习暂停门与轨迹读取之间的相互作用。循环变压器通过重复应用共享循环块来增加测试时的计算量,这使得它们能够在推理时动态调整计算深度。然而,学习暂停目标通常使用单一的退出分布,既作为推理时的停止规则,又作为训练时各深度损失的权重。这种设计将退出选择与轨迹形成紧密纠缠:门控不仅决定使用哪个循环状态,还决定了每个中间状态被监督的强度。因此,自适应计算性能不佳可能源于读取器、诱导轨迹或两者的交互作用,而传统方法往往只关注门控本身。

为了深入探究这一问题,研究者从轨迹-读取视角出发,在模块化算术、二进制奇偶性等合成任务以及大规模Ouro-1.4B和2.6B检查点上进行了系统诊断。合成任务允许精确控制难度,而大规模模型则检验发现的泛化能力。他们发现,采用固定先验深度监督(即不依赖输入暂停策略来塑造轨迹)能够产生具有难度感知的轨迹,这些轨迹的中间状态暴露了有用的停止信号。例如,在二进制奇偶性任务中,简单任务状态在早期就显示出高置信度,而复杂任务则延迟。同时,简单的后验置信度读取器往往能够匹配甚至超越学习得到的线性门控和MLP门控。这一发现表明,门控的表达能力并非主要限制因素。

通过在冻结轨迹上拟合门控,研究者定位了失败原因:主要来自联合门训练诱导的轨迹问题,而非门控表达能力不足。具体来说,当门控与轨迹共同训练时,它们相互影响,导致轨迹无法有效反映任务难度。而在固定轨迹上训练门控,则能轻松达到良好性能。在Ouro评估中,研究者观察到了相同的模式。预训练的暂停门虽然具有竞争力,但并非均匀的帕累托最优。实测延迟证实,平均退出深度的减少能够转化为实际的推理时间节省,这对于部署具有重要意义。

这项工作将自适应深度重新定义为轨迹形成与退出读取的联合问题,而不仅仅是门控学习,强调了先前研究经常忽略的这一关键区别。该发现对于模型选型、推理成本优化以及产品能力提升具有重要意义,并为未来设计更高效的自适应计算机制提供了新方向。