长度价值模型:面向令牌级长度建模的可扩展价值预训练
苹果研究人员提出长度价值模型(LenVM),一种在解码每一步预测剩余生成长度的令牌级框架。通过将长度建模转化为价值估计问题,并赋予每个生成令牌恒定负奖励,LenVM实现了无标注、密集、无偏且可扩展的监督。在LLM和VLM上的实验显示,在LIFEBench精确长度匹配任务中,LenVM将7B模型的长度分数从30.9提升至64.8,超越前沿闭源模型。此外,LenVM支持长度控制、预测和生成动态解释。
苹果机器学习研究团队近日发布了长度价值模型(Length Value Model, LenVM),这是一种创新的令牌级框架,旨在在自回归模型的解码过程中精确建模剩余生成长度。该研究源于对令牌作为现代自回归模型基本计算单元的深刻理解,生成长度直接关系到推理成本与推理性能,然而现有方法大多局限于粗粒度的序列级长度建模。
LenVM将长度建模转化为价值估计问题:每个生成的令牌被赋予一个恒定负奖励,模型通过预测经过折扣的回报来指示剩余生成长度。这种形式的监督具有无标注、密集、无偏且可扩展的优点。实验基于大型语言模型(LLM)和视觉语言模型(VLM)进行,结果令人瞩目。在LIFEBench精确长度匹配任务中,应用LenVM的7B模型将长度分数从30.9大幅提升至64.8,显著优于前沿闭源模型。
此外,LenVM实现了对性能与效率之间权衡的连续控制。在GSM8K任务上,当令牌预算为200时,LenVM保持了63%的准确率,而基准方法仅为6%。LenVM还能从提示边界准确预测总生成长度。其令牌级价值提供了生成动态的可解释视角,揭示了特定令牌如何将推理导向更短或更长的模式。
该页面还提到了另外两项相关研究:一项是《Transformer长度泛化的形式化框架》(ICLR 2025),从理论层面分析因果关系Transformer在长序列上的泛化能力;另一项是《数据集分解:基于可变序列长度课程的更快LLM训练》(NeurIPS 2024),提出通过可变长度序列课程加速训练。这些工作共同推动了语言模型对长度控制与理解的研究。