AI News HubLIVE
站內改寫1 分鐘閱讀

大語言模型中的分層分級

該論文提出了一種名為分級大語言模型(GLLMs)的代數框架,透過為Transformer表示空間引入分級,並傳播誘導的加權標量作用,在保持表達能力、計算複雜度和推理成本的同時,擴充套件了分級神經網路和分級Transformer到自迴歸語言模型。幾何上,分級的好處由Kempf-Ness泛函表示,最優分級由兩個矩對映的重合點給出,而普通Transformer作為邊界上的半穩定各向同性點。此外,對於分層目標,證明了分級先驗與無分級先驗之間的極小極大分離。

來源arXiv Machine Learning作者: T. Shaska

近年來,大型語言模型(LLMs)取得了顯著進展,但如何有效利用資料的層次結構仍是一個挑戰。近日,一篇題為《大語言模型中的分層分級》的論文提出了一種名為分級大語言模型(GLLMs)的代數框架,旨在透過引入分級結構來提升Transformer的表達能力和效率。

該框架為Transformer的表示空間賦予一個分級,並允許這種分級透過嵌入、自注意力機制和訓練目標傳播。在保持模型表達能力和漸近計算複雜度的同時,GLLMs將分級神經網路和分級Transformer的理念擴充套件到自迴歸語言模型。這意味著模型可以在不增加推理成本的情況下,更好地捕捉資料中的層次結構。

從幾何角度看,該工作基於幾何不變數理論。分級的好處透過Kempf-Ness泛函進行度量,而最優分級可以透過兩個矩對映的重合點封閉形式給出。有趣的是,普通Transformer被證明是分級族中的一個半穩定各向同性點,位於一個開放凸錐的邊界上,而非一個孤立的全域性最優。這一發現挑戰了我們對Transformer最優性的傳統認知,表明標準Transformer實際上是更大分級家族的一個特例。

對於具有層次結構的目標,論文證明了分級先驗能帶來顯著的極小極大分離:在特定的樣本量視窗內,基於分級先驗的估計器風險遠低於均勻模型。這種分離隨著層級數量的增加呈指數級衰減,且所需的分級配置可在訓練前透過離線估計解決一個凸規劃得到。這為在訓練前確定最優分級提供了理論保證。

由於訓練後分級資訊被吸收到引數中,每個GLLM可以編譯為架構和推理複雜度完全相同的標準Transformer。這意味著GLLMs提供了一種無需增加推理成本即可提升效能的通用方法。作者指出,該方法不僅適用於自迴歸語言模型,還可以推廣到其他架構。該工作為設計更高效、更適應資料結構的語言模型開闢了新方向,對於自然語言處理領域具有重要的理論價值和實踐意義。未來,研究者可以基於此框架探索更復雜的分級結構,進一步提升模型在多層次任務上的表現。