AI News HubLIVE
站内改写2 分钟阅读

MemoHood 和 MemoBase:AI 智能体的本地记忆与知识库

MemoBase 是一个 hermes-agent 插件,可将文件、网页、YouTube 视频、音频和 Obsidian 笔记等本地资源转化为知识库,通过混合搜索、引用验证和反幻觉机制确保回答准确可靠。

来源Hacker News AI作者: maxskorohood

MemoBase 是一款为 hermes-agent 设计的插件,旨在将用户的本地文件、网页、YouTube 视频、音频记录以及 Obsidian 笔记等多元信息源转化为一个可检索的本地知识库。与传统的语言模型直接调用不同,MemoBase 严格基于其索引的知识库进行回答,确保每一条回复都有据可查,有效避免了模型幻觉问题。

该插件的核心工作流程分为两个阶段:一是数据摄入(ingest),二是查询回答(ask/query)。在摄入阶段,系统能处理 PDF(通过 pdfplumber,回退至 pypdf)、DOCX(mammoth)、HTML 与 URL(trafilatura,带 SSRF 检查)、Markdown、TXT、CSV 等常见格式。对于 YouTube,它能自动获取字幕(通过 ScrapeCreators 或 Apify),无字幕时则下载音频并使用 Groq Whisper 进行语音转文字,并保留时间戳。音频和视频文件同样支持转写,长文件会自动切分。Obsidian 笔记以只读方式加载,自动识别 vault、frontmatter 和 [[链接]]。

在查询阶段,MemoBase 采用混合搜索策略:结合 FTS5(BM25 算法 + 俄语词干提取)和向量搜索(Cloudflare BGE-M3,1024 维),通过 RRF(k=60)融合结果,再经 Cohere rerank-v3.5 重新排序。回答生成前先通过“充足性门控”,仅当找到足够相关的片段时才允许模型回答;回答时模型只能基于提供的片段(tool-less 模式),并且每个引用都必须与原文逐字匹配(或模糊匹配),否则模型将诚实拒绝。

为保障安全,MemoBase 内置了六项不可关闭的保护机制:SSRF 防护、原始分块隔离、降级模式下的阈值调整、向量迁移的影子表、子声明验证以及旧分片的清除。它还支持访客集合,允许宿主为访客创建独立的个人知识库,并设置配额与权限。

安装过程极为简便:只需一条命令即可完成插件复制、依赖安装和配置启用。用户无需手动编辑配置,安装脚本会自动完成所有步骤。整个知识库存储在一个本地 SQLite 文件中(/memobase/memobase.db),向量索引也完全本地化,外部仅发送必要的查询和片段用于嵌入和重排序。

总之,MemoBase 提供了一个轻量级、可本地部署的 RAG 解决方案,特别适合需要高准确性、强隐私保护且避免模型幻觉的场景。它不仅降低了使用成本和门槛,还通过严密的引用验证机制确保了回答的可信度。