長度價值模型:面向令牌級長度建模的可擴充套件價值預訓練
蘋果研究人員提出長度價值模型(LenVM),一種在解碼每一步預測剩餘生成長度的令牌級框架。透過將長度建模轉化為價值估計問題,並賦予每個生成令牌恆定負獎勵,LenVM實現了無標註、密集、無偏且可擴充套件的監督。在LLM和VLM上的實驗顯示,在LIFEBench精確長度匹配任務中,LenVM將7B模型的長度分數從30.9提升至64.8,超越前沿閉源模型。此外,LenVM支援長度控制、預測和生成動態解釋。
蘋果機器學習研究團隊近日釋出了長度價值模型(Length Value Model, LenVM),這是一種創新的令牌級框架,旨在在自迴歸模型的解碼過程中精確建模剩餘生成長度。該研究源於對令牌作為現代自迴歸模型基本計算單元的深刻理解,生成長度直接關係到推理成本與推理效能,然而現有方法大多侷限於粗粒度的序列級長度建模。
LenVM將長度建模轉化為價值估計問題:每個生成的令牌被賦予一個恆定負獎勵,模型透過預測經過折扣的回報來指示剩餘生成長度。這種形式的監督具有無標註、密集、無偏且可擴充套件的優點。實驗基於大型語言模型(LLM)和視覺語言模型(VLM)進行,結果令人矚目。在LIFEBench精確長度匹配任務中,應用LenVM的7B模型將長度分數從30.9大幅提升至64.8,顯著優於前沿閉源模型。
此外,LenVM實現了對效能與效率之間權衡的連續控制。在GSM8K任務上,當令牌預算為200時,LenVM保持了63%的準確率,而基準方法僅為6%。LenVM還能從提示邊界準確預測總生成長度。其令牌級價值提供了生成動態的可解釋視角,揭示了特定令牌如何將推理導向更短或更長的模式。
該頁面還提到了另外兩項相關研究:一項是《Transformer長度泛化的形式化框架》(ICLR 2025),從理論層面分析因果關係Transformer在長序列上的泛化能力;另一項是《資料集分解:基於可變序列長度課程的更快LLM訓練》(NeurIPS 2024),提出透過可變長度序列課程加速訓練。這些工作共同推動了語言模型對長度控制與理解的研究。