AI News HubLIVE
站內改寫1 分鐘閱讀

在領先AI記憶基準測試中排名第一,使用更小更便宜模型

Exabase的M-1記憶引擎在LongMemEval基準測試中達到96.4%的準確率,使用Gemini 3 Flash模型,無需特定提示工程,展示了高效檢索架構的優勢。

來源Hacker News AI作者: johnnymakes

Exabase宣佈其第一代長期記憶引擎Mneme-1(M-1)在LongMemEval基準測試中取得了最先進的結果。使用相對小型且成本效益高的模型Gemini 3 Flash,M-1在top-50檢索深度達到96.4%的準確率,且無需針對特定問題的提示工程。這一突破凸顯了複雜檢索架構相對於單純依賴大型前沿模型的潛力。

LongMemEval是一個旨在測試對話AI長期記憶的挑戰性基準。它包括500個問題,涵蓋六個類別:單會話使用者資訊、助手提供資訊、偏好、多會話推理、時序推理和知識更新。該基準包含約115,000個令牌的對話歷史,相關資訊稀疏分佈。M-1在單會話任務上表現出近乎完美的效能,在多會話推理(94.0%)和時序推理(95.5%)方面也取得了強勁結果。

M-1的架構受認知科學啟發,將記憶視為一個重構過程。其檢索管道包括三個階段:首先,根據語義、詞彙和時間因素對候選記憶進行評分;其次,將查詢分解為多個並行傳遞以收集來自不同來源的資訊;最後,對結果進行重排序以確保連貫性和重要性。這種方法使M-1能夠有效檢索相關記憶,而無需依賴大上下文視窗或昂貴模型。

結果表明,M-1的檢索既高效又穩健。效能在top-50達到峰值,之後額外的上下文引入噪聲,證實系統能有效對相關記憶進行排名。總體而言,M-1為生產就緒的長期記憶系統設定了新標準,證明小型模型結合智慧檢索可以超越大型模型。