AI News HubLIVE
サイト内リライト2 分で読了

マスク拡散言語モデルは強力で制御可能なテキストベースの世界モデル:エージェント強化学習に向けて

強化学習の発展に伴い、多様な訓練環境が必要とされている。世界モデルは環境をシミュレートできるが、自己回帰モデルには左から右へのバイアスがある。マスク拡散言語モデル(MDLM)は双方向のアンカー認識ノイズ除去によりこれを克服し、4倍のパラメータサイズのLLMよりも高いコヒーレンスと多様性を達成。GRPO訓練フレームワークを導入し、ゼロショット転移で最大47%の絶対的な性能向上を示した。研究はオープンソースとして公開されている。

ソースarXiv AI著者: Darshan Deshpande

強化学習(RL)の急速な発展は、多様で専門的な訓練環境への需要を顕在化させています。手動で設計された固定タスクと報酬難易度の環境は、モデルの性能向上に伴い効果的な信号を提供できなくなり、長期的なスパース報酬は特定のワークフローやツール構造へのモード崩壊を引き起こします。世界モデルは環境状態をシミュレートし、純粋なロールアウト性能で現実環境に匹敵するため、オンデマンドで多様性を拡張する有望な手段です。しかし、自己回帰(AR)世界モデルには左から右へのバイアスがあり、ツールスキーマ、以前のターン、期待される結果などのグローバルに相互依存する状態アンカーに基づく条件付けができません。

本研究では、テキストベースの世界モデリングを、初期状態、タスクコンテキスト、ツールスキーマ、ドメインルール、誘導指示に分解された制御可能な遷移力学問題として形式化します。さらに、9つのオープンソース環境と12のフロンティアモデルファミリーにわたる239,403の接地された状態行動軌跡をキュレーションしました。AR言語モデルとマスク拡散言語モデル(MDLM)を比較した結果、MDLMは双方向アンカー認識ノイズ除去により、コヒーレンス、接地性、および経験的に検証されたロールアウト多様性において、4倍のパラメータサイズのLLMよりも優れており、推論レイテンシは同等であることが示されました。

また、決定論的状態チェックを備えたプラグアンドプレイのGRPO訓練フレームワークを導入し、3つのOOD環境(ScienceWorld、ALFWorld、AppWorld)において、3つの1.2B-7Bエージェントバックボーン(LFM2.5、Qwen3、Mistral)でゼロショット転移アブレーションを実施しました。その結果、環境固有の微調整なしでベースラインに対して最大47%の絶対的なゲインを達成しました。さらに、敵対的シナリオ下での故障モードの行動分析と、現実性、結果正確性、訓練実用性に関する人間評価を実施しました。研究を促進するため、すべての作業をオープンソースとして公開しています。