AI News HubLIVE
サイト内リライト1 分で読了

混合専門家モデルにおける一貫した専門家選択のためのマルチレベルコンテキストモデリング

混合専門家モデル(MoE)は、トークンを少数の専門家にルーティングすることでTransformerモデルを効率的にスケーリングする。しかし、既存のルーターは浅いまたは孤立したトークン表現に基づいて専門家を選択するため、不安定で意味的に一貫しないルーティング決定を生じる。本稿では、表現の観点から専門家選択を再検討し、クロスレイヤーの意味的集約と局所トークンレベルの相互作用からの補完的信号を統合してコンテキスト認識表現を構築するMCF-MoEを提案する。実験により、MCF-MoEがルーティングの一貫性と下流性能を向上させることが示された。

ソースarXiv Computational Linguistics著者: Shuhan Huang, Naifan Zhang, Yuanbo Tang, Yang Li, Wai Kin Victor Chan

近年、混合専門家モデル(MoE)は、トークンを少数の専門家にルーティングすることでTransformerモデルの効率的なスケーリングを可能にする技術として注目されている。しかし、既存のルーターは浅いまたは孤立したトークン表現に基づいて専門家を選択するため、層間でルーティング決定が不安定になり、意味的に一貫性が損なわれるという問題がある。この問題を解決するため、Shuhan HuangらはarXivに投稿した論文で、マルチレベルコンテキスト融合MoE(MCF-MoE)フレームワークを提案した。

MCF-MoEは、表現学習の観点から専門家選択を再検討し、クロスレイヤーの意味的集約と局所トークンレベルの相互作用からの補完的信号を統合することで、コンテキストを認識したトークン表現を構築する。具体的には、クロスレイヤーアテンション機構を用いてグローバルな意味情報を取得し、同時に局所的なトークン間の細かい相互作用を保持することで、ルーティング決定にグローバルとローカルの両方のコンテキストを反映させる。

実験では、言語モデリングおよび理解ベンチマークにおいて、MCF-MoEがルーティングの一貫性と下流タスクの性能で既存の強力なMoEベースラインを一貫して上回ることが示された。例えば、パープレキシティ(PPL)やGLUEスコアなどの指標で顕著な改善が見られた。この結果は、専門家ルーティングにおけるコンテキストの完全性の重要性を強調している。コードは匿名リポジトリで公開されており、研究者が再現やさらなる発展に利用できる。この研究は、特に大規模言語モデルや推薦システムなど、安定した意味的一貫性が求められるシナリオにおいて、MoEの応用を促進することが期待される。