どのエージェントがタスク失敗を引き起こし、いつか?PSUとデューク大学の研究者がLLMマルチエージェントシステムの自動故障帰属を探る
ペンシルベニア州立大学とデューク大学の研究者らが、Google DeepMindなどとの協力のもと、LLMマルチエージェントシステムにおける自動故障帰属の問題を提唱。Who&Whenベンチマークデータセットを構築し、All-at-Once、Step-by-Step、Binary Searchの各手法を評価。ICML 2025でスポットライト発表される本研究成果は、開発者がどのエージェントがどのステップで失敗を引き起こしたかを迅速に特定するのに役立つ。現行手法の精度は、責任エージェントの特定で最大53.5%、エラーステップの特定で14.2%にとどまる。
MIT研究者、自己改善AIへの新たな一歩「SEAL」を発表
MITのSEALフレームワークは、大規模言語モデルが強化学習を通じて自身の重みを自己編集・更新することを可能にし、AIの自己進化に向けた重要な進展を示す。
ペンシルベニア州立大学とデューク大学の研究者が「マルチエージェントシステムの自動故障帰属」を発表
LLMマルチエージェントシステムの故障診断の難しさに対処するため、研究者らは初めて「自動故障帰属」タスクを定義し、Who&Whenベンチマークデータセットを構築し、3つの帰属手法を評価した。実験では、最良の手法でも責任エージェントの識別精度が53.5%、誤りステップの正確な特定が14.2%にとどまり、課題の困難さが浮き彫りになった。本論文はICML 2025でスポットライト発表として採択された。
Adobe Research、状態空間モデルを用いてビデオ世界モデルの長期記憶を実現
Adobe Research、スタンフォード大学、プリンストン大学の研究チームは、状態空間モデル(SSM)と密な局所注意を組み合わせた新しいアーキテクチャを提案し、ビデオ生成における長期記憶の課題を解決した。ブロック単位のSSMスキャン、拡散強制、フレーム局所注意などの戦略により、Memory MazeやMinecraftデータセットで優れた性能を達成し、計算効率を維持しながらインタラクティブな応用を可能にする。
DeepSeek-V3新論文発表!ハードウェア認識協調設計による低コスト大規模モデルトレーニングの秘密を解明
DeepSeek-V3チームが14ページの技術論文を発表。CEOの梁文鋒氏が共著者として参加し、スケーリングの課題を克服するためのハードウェア認識モデル協調設計を探求。マルチヘッド潜在注意(MLA)、DeepSeekMoE、FP8トレーニング、ノード認識ルーティングなどの革新を詳述し、コスト効率の高い大規模トレーニングと推論を実現。
DeepSeek、DeepSeek-Prover-V2を発表:再帰的証明検索と新しいベンチマークによるニューラル定理証明の進展
DeepSeek AIは、Lean 4形式定理証明のためのオープンソース大規模言語モデルDeepSeek-Prover-V2をリリース。DeepSeek-V3を用いた再帰的証明検索パイプラインと強化学習により、MiniF2Fでトップ結果を達成。同時に新ベンチマークProverBenchを導入。
GRPOの効率を10倍にできるか?Kwai AIのSRPOが「はい」と答える
Kwai AIのSRPOフレームワークは、LLMのRL後訓練ステップを90%削減し、数学とコードでDeepSeek-R1に匹敵する性能を実現。ヒストリーリサンプリングを用いた2段階RLアプローチがGRPOの限界を克服する。
Zhipu.AI、オープンソース戦略を強化:GLMモデルを8倍高速化、グローバル展開へ、IPOも視野
中国のAI企業Zhipu.AIが、次世代GLMモデルシリーズをオープンソース化。DeepSeek-R1の8倍の推論速度を誇るGLM-Z1、自律エージェント向けのRuminationモデル、エージェント機能を強化したGLM-4などを発表。国際プラットフォームZ.aiもローンチし、MaaSも提供。技術力とグローバル展開への野心を示し、IPOの布石と見られる。
DeepSeek、次世代R2モデルを示唆、SPCTによる推論スケーリングの新手法を公開
DeepSeek AIは、汎用報酬モデルの推論時スケーラビリティを向上させる新技術を詳述した研究論文を発表し、次世代モデルR2の差し迫った登場を示唆した。