在领先AI记忆基准测试中排名第一,使用更小更便宜模型
Exabase的M-1记忆引擎在LongMemEval基准测试中达到96.4%的准确率,使用Gemini 3 Flash模型,无需特定提示工程,展示了高效检索架构的优势。
Exabase宣布其第一代长期记忆引擎Mneme-1(M-1)在LongMemEval基准测试中取得了最先进的结果。使用相对小型且成本效益高的模型Gemini 3 Flash,M-1在top-50检索深度达到96.4%的准确率,且无需针对特定问题的提示工程。这一突破凸显了复杂检索架构相对于单纯依赖大型前沿模型的潜力。
LongMemEval是一个旨在测试对话AI长期记忆的挑战性基准。它包括500个问题,涵盖六个类别:单会话用户信息、助手提供信息、偏好、多会话推理、时序推理和知识更新。该基准包含约115,000个令牌的对话历史,相关信息稀疏分布。M-1在单会话任务上表现出近乎完美的性能,在多会话推理(94.0%)和时序推理(95.5%)方面也取得了强劲结果。
M-1的架构受认知科学启发,将记忆视为一个重构过程。其检索管道包括三个阶段:首先,根据语义、词汇和时间因素对候选记忆进行评分;其次,将查询分解为多个并行传递以收集来自不同来源的信息;最后,对结果进行重排序以确保连贯性和重要性。这种方法使M-1能够有效检索相关记忆,而无需依赖大上下文窗口或昂贵模型。
结果表明,M-1的检索既高效又稳健。性能在top-50达到峰值,之后额外的上下文引入噪声,证实系统能有效对相关记忆进行排名。总体而言,M-1为生产就绪的长期记忆系统设定了新标准,证明小型模型结合智能检索可以超越大型模型。