より小型で安価なモデルを使用し、主要AIメモリベンチマークで第1位
ExabaseのM-1メモリエンジンは、LongMemEvalベンチマークで96.4%の精度を達成し、Gemini 3 Flashという小型モデルを使用し、プロンプトエンジニアリングなしで効率的な検索アーキテクチャを示しました。
Exabaseは、第1世代の長期メモリエンジンMneme-1(M-1)がLongMemEvalベンチマークで最先端の結果を達成したと発表しました。比較的小型でコスト効率の高いモデルであるGemini 3 Flashを使用し、M-1はトップ50検索深度で96.4%の精度を達成し、特定の質問に対するプロンプトエンジニアリングを必要としませんでした。この進歩は、大規模なフロンティアモデルに頼るのではなく、洗練された検索アーキテクチャの可能性を強調しています。
LongMemEvalは、会話型AIの長期メモリをテストするために設計された挑戦的なベンチマークです。500の質問が6つのカテゴリ(単一セッションユーザー情報、アシスタント提供情報、好み、マルチセッション推論、時間的推論、知識更新)にわたって含まれています。ベンチマークは約115,000トークンの会話履歴で構成され、関連情報は疎らに分布しています。M-1は単一セッションタスクでほぼ完璧なパフォーマンスを示し、マルチセッション推論(94.0%)および時間的推論(95.5%)でも強力な結果を達成しました。
M-1のアーキテクチャは認知科学に触発され、メモリを再構築プロセスとして扱います。検索パイプラインは3つのフェーズで構成されます。最初に、候補メモリは意味的、語彙的、時間的要因に基づいてスコアリングされます。次に、クエリは複数のパスに分解され、さまざまなソースから情報を収集します。最後に、結果は一貫性と重要性のために再ランク付けされます。このアプローチにより、M-1は大きなコンテキストウィンドウや高価なモデルに依存せずに関連メモリを効果的に取得できます。
結果は、M-1の検索が効率的かつ堅牢であることを示しています。パフォーマンスはトップ50でピークに達し、その後追加のコンテキストがノイズをもたらすため、システムが関連メモリを効果的にランク付けしていることが確認されます。全体として、M-1はプロダクション対応の長期メモリシステムの新たな基準を設定し、小型モデルとインテリジェントな検索の組み合わせが大型モデルを凌駕できることを証明しています。