AI News HubLIVE
站內改寫1 分鐘閱讀

多級上下文建模實現混合專家模型中的一致專家選擇

混合專家模型(MoE)透過將令牌路由到一小部分專家來高效擴充套件Transformer模型。然而,現有路由器通常基於淺層或孤立的令牌表示來選擇專家,導致路由決策不穩定且語義不一致。本文從表示角度重新審視專家選擇,並提出多級上下文融合MoE(MCF-MoE)框架,透過整合跨層語義聚合和區域性令牌互動的互補訊號來構建上下文感知表示,從而實現更資訊豐富且一致的專家選擇。實驗表明,MCF-MoE在路由一致性和下游效能上均優於強基線,凸顯了上下文完整性在專家路由中的重要性。

來源arXiv Computational Linguistics作者: Shuhan Huang, Naifan Zhang, Yuanbo Tang, Yang Li, Wai Kin Victor Chan

在人工智慧領域,混合專家模型(Mixture-of-Experts, MoE)因其能夠透過將輸入令牌路由到一小部分專家來高效擴充套件Transformer模型而備受關注。然而,現有路由機制通常基於淺層或孤立的令牌表示進行專家選擇,這導致不同層之間的路由決策不穩定且語義上不一致,從而限制了專家模型的有效分工。針對這一關鍵瓶頸,Shuhan Huang等學者在arXiv上發表的論文中提出了多級上下文融合MoE(Multi-level Context Fusion MOE, MCF-MoE)框架。

該框架從表示學習角度出發,致力於構建具有豐富上下文資訊的令牌表示。透過整合跨層語義聚合和區域性令牌級別的互動訊號,MCF-MoE使得路由決策能夠同時捕捉全域性語義和區域性細節。具體而言,跨層注意力機制負責聚合來自不同層的語義資訊,而區域性令牌互動則保留細粒度的鄰近上下文。這種多級上下文融合策略確保了專家選擇的穩定性和一致性。

在語言建模和語言理解基準上的實驗驗證了MCF-MoE的有效性。與強基線相比,MCF-MoE在路由一致性指標和下游任務效能(如困惑度和GLUE分數)上均取得了顯著提升。例如,在GPT-2和BERT等模型上的測試表明,MCF-MoE能夠有效減少路由波動,同時提高任務準確率。該研究的程式碼已公開發布在匿名倉庫中,便於研究者復現和進一步探索。這一成果不僅深化了對MoE路由機制的理解,也為構建更穩定、高效的AI模型提供了新思路。未來,MCF-MoE有望在大型語言模型、多模態系統等領域發揮重要作用。