在領先AI記憶基準測試中排名第一,使用更小更便宜模型
Exabase的M-1記憶引擎在LongMemEval基準測試中達到96.4%的準確率,使用Gemini 3 Flash模型,無需特定提示工程,展示了高效檢索架構的優勢。
Exabase宣佈其第一代長期記憶引擎Mneme-1(M-1)在LongMemEval基準測試中取得了最先進的結果。使用相對小型且成本效益高的模型Gemini 3 Flash,M-1在top-50檢索深度達到96.4%的準確率,且無需針對特定問題的提示工程。這一突破凸顯了複雜檢索架構相對於單純依賴大型前沿模型的潛力。
LongMemEval是一個旨在測試對話AI長期記憶的挑戰性基準。它包括500個問題,涵蓋六個類別:單會話用户信息、助手提供信息、偏好、多會話推理、時序推理和知識更新。該基準包含約115,000個令牌的對話歷史,相關信息稀疏分佈。M-1在單會話任務上表現出近乎完美的性能,在多會話推理(94.0%)和時序推理(95.5%)方面也取得了強勁結果。
M-1的架構受認知科學啓發,將記憶視為一個重構過程。其檢索管道包括三個階段:首先,根據語義、詞彙和時間因素對候選記憶進行評分;其次,將查詢分解為多個並行傳遞以收集來自不同來源的信息;最後,對結果進行重排序以確保連貫性和重要性。這種方法使M-1能夠有效檢索相關記憶,而無需依賴大上下文窗口或昂貴模型。
結果表明,M-1的檢索既高效又穩健。性能在top-50達到峯值,之後額外的上下文引入噪聲,證實系統能有效對相關記憶進行排名。總體而言,M-1為生產就緒的長期記憶系統設定了新標準,證明小型模型結合智能檢索可以超越大型模型。