MemoHood 和 MemoBase:AI 智能體的本地記憶與知識庫
MemoBase 是一個 hermes-agent 插件,可將文件、網頁、YouTube 視頻、音頻和 Obsidian 筆記等本地資源轉化為知識庫,通過混合搜索、引用驗證和反幻覺機制確保回答準確可靠。
MemoBase 是一款為 hermes-agent 設計的插件,旨在將用户的本地文件、網頁、YouTube 視頻、音頻記錄以及 Obsidian 筆記等多元信息源轉化為一個可檢索的本地知識庫。與傳統的語言模型直接調用不同,MemoBase 嚴格基於其索引的知識庫進行回答,確保每一條回覆都有據可查,有效避免了模型幻覺問題。
該插件的核心工作流程分為兩個階段:一是數據攝入(ingest),二是查詢回答(ask/query)。在攝入階段,系統能處理 PDF(通過 pdfplumber,回退至 pypdf)、DOCX(mammoth)、HTML 與 URL(trafilatura,帶 SSRF 檢查)、Markdown、TXT、CSV 等常見格式。對於 YouTube,它能自動獲取字幕(通過 ScrapeCreators 或 Apify),無字幕時則下載音頻並使用 Groq Whisper 進行語音轉文字,並保留時間戳。音頻和視頻文件同樣支持轉寫,長文件會自動切分。Obsidian 筆記以只讀方式加載,自動識別 vault、frontmatter 和 [[鏈接]]。
在查詢階段,MemoBase 採用混合搜索策略:結合 FTS5(BM25 算法 + 俄語詞幹提取)和向量搜索(Cloudflare BGE-M3,1024 維),通過 RRF(k=60)融合結果,再經 Cohere rerank-v3.5 重新排序。回答生成前先通過“充足性門控”,僅當找到足夠相關的片段時才允許模型回答;回答時模型只能基於提供的片段(tool-less 模式),並且每個引用都必須與原文逐字匹配(或模糊匹配),否則模型將誠實拒絕。
為保障安全,MemoBase 內置了六項不可關閉的保護機制:SSRF 防護、原始分塊隔離、降級模式下的閾值調整、向量遷移的影子表、子聲明驗證以及舊分片的清除。它還支持訪客集合,允許宿主為訪客創建獨立的個人知識庫,並設置配額與權限。
安裝過程極為簡便:只需一條命令即可完成插件複製、依賴安裝和配置啓用。用户無需手動編輯配置,安裝腳本會自動完成所有步驟。整個知識庫存儲在一個本地 SQLite 文件中(/memobase/memobase.db),向量索引也完全本地化,外部僅發送必要的查詢和片段用於嵌入和重排序。
總之,MemoBase 提供了一個輕量級、可本地部署的 RAG 解決方案,特別適合需要高準確性、強隱私保護且避免模型幻覺的場景。它不僅降低了使用成本和門檻,還通過嚴密的引用驗證機制確保了回答的可信度。