Token Saver:開源MCP擴展,利用本地混合RAG將Claude PDF令牌成本削減90-99%
Token Saver 是一個開源的 MCP 擴展,通過本地混合 RAG 技術,在保證文檔絕對隱私的同時,將 Claude Desktop 處理 PDF 的令牌消耗降低最多 99%。它無需 Python 環境,一鍵安裝即可使用。
AI 開發人員、研究人員和專業人士在使用大型語言模型分析大型文檔時,常常會遇到一個令人沮喪的問題:上下文窗口帶來的隱性且不斷累積的成本。將一份 200 頁的 PDF 粘貼到聊天中並非一次性付費。由於對話歷史會在每次交互時重新發送給模型,因此每提出一個後續問題,都需要為這份龐大文檔再次付費。
Marktechpost AI 團隊剛剛發佈了 Token Saver,這是一個開源的模型上下文協議(MCP)擴展,適用於 Claude Desktop(MIT 許可,當前版本 v1.0)。它是由 Marktechpost AI Media Inc 的 Arnav Rai(羅切斯特理工學院計算機科學學生)在 Marktechpost 實習期間,在 Jean-marc Mommessin 和 Asif Razzaq 的指導下開發的。Token Saver 從根本上改變了 Claude 與本地文檔的交互方式。通過在你的本地機器上直接實現本地混合 RAG 系統,你可以詢問關於大規模 PDF 的問題,而無需將實際文件上傳到模型。
令牌消耗降低了 92% 到 99%,隱私得到了保障,並且安裝過程完全不需要任何 Python 環境或終端配置。
大型 PDF 的隱性令牌消耗
大多數用户認為,當他們將 PDF 放入 Claude 時,它只是簡單地提取文本。實際上,Claude 的默認行為是將每一頁轉換為圖像以保留圖表和佈局,同時單獨提取文本。在計算單個圖像令牌之前,僅文本部分每頁就可能消耗 1,500 到 3,000 個令牌。
雖然 Prompt Caching 和 Claude Projects 有助於緩解這一問題,但它們並沒有解決核心問題:整個文檔仍然需要跨越邊界傳輸到提供商的服務器。此外,如果你只需要從一本 1000 頁的教科書中找到兩個相關段落,強制 LLM 搜索整個 1000 頁既低效又容易產生幻覺。
本地混合 RAG 如何解決問題
Marktechpost 的 Token Saver 作為一個本地 MCP 服務器運行:一個在你機器上運行的後台輕量級程序,Claude 可以將其作為工具調用。PDF 永遠不會離開你的硬盤。
當你提出問題時,Token Saver 會利用本地混合 RAG 來查找答案。混合 RAG 是文檔檢索的黃金標準,因為它結合了兩種強大的搜索方法:
關鍵詞匹配(BM25):利用 SQLite 內置的 FTS5 搜索(權重 0.4)查找精確術語。 語義搜索(餘弦相似度):使用本地的 all-MiniLM-L6-v2 嵌入模型(權重 0.6)理解你問題的含義,而不僅僅是匹配精確詞語。 通過這兩種方法本地結合,服務器搜索文件並向 Claude 僅提供高度相關的段落。然後 Claude 綜合答案,引用精確頁碼,並提供你剛剛節省的令牌數的實時統計。
8 階段處理流程
Token Saver 完全在一個單一的、長時間運行的本地進程內運行。在任何文本到達 Claude 之前,本地混合 RAG 流程執行八個快速步驟:
提取:使用 pypdfium2(備選 pypdf)提取文本。 分塊:將文本分割成 180 個單詞的段落,重疊 40 個單詞,以確保上下文不被盲目切斷。 評分(混合 RAG):使用混合的 BM25 和本地嵌入模型評估塊。 門控:強制執行質量閾值。沒有共享關鍵詞的段落必須通過 0.25 的語義相似度下限才有資格。 去重:丟棄幾乎相同的段落。 修剪:將段落嚴格縮小到回答用户提示的句子。 預算:將發送給 Claude 的總負載限制在 8,000 個字符。 封裝:將檢索到的文本包裝在包含源文件和精確頁碼的文檔塊元素中。 (注意:嵌入模型是可選的但推薦使用。如果加載失敗,系統會優雅地回退到僅關鍵詞匹配)。
數據:規模化節省 99%
由於混合 RAG 流程限制了返回的文本切片,令牌節省隨文檔大小呈指數增長。以下是 Token Saver 在基準測試中的表現(通過 tiktoken 測量,假設每份文檔一個問題):
文檔 頁數 全文令牌數 返回令牌數 節省百分比 FDA 藥品標籤 33 23,959 1,021 95.7% GDPR(EU 2016/679) 88 70,260 996 98.6% SFFA v. Harvard 233 133,349 740 99.4%
免責聲明:令牌計數使用 cl100k_base 作為替代,基線假設每次搜索都按整個文檔計費。
對於經常處理法院意見、技術標準、財務報告或密集教科書的專業人士來説,Token Saver 消除了重複的令牌税。
安全與本地隱私
對於企業用户和法律專業人士而言,數據隱私是不可談判的。Token Saver 的安全模型基於三個支柱:
零上傳:文檔從不離開你的機器。 文件夾白名單:你為 Token Saver 配置一個特定文件夾。服務器會主動拒絕讀取此指定目錄之外的文件。 網絡隔離:服務器僅通過標準 I/O(stdio)與 Claude Desktop 通信。沒有監聽網絡端口,大大減少了攻擊面。
模型性能:Sonnet vs. Opus
Marktechpost 的 Token Saver 在所有三個 Claude 3.5 層級上都能工作,但測試揭示了不同的行為:
Claude 3.5 Sonnet(推薦):合理的默認選項。它能完美處理鬆散的文件引用,如果兩個文件名相似會提出澄清性問題,並正確應用檢索到的頁碼。 Claude 3 Opus:擅長處理包含多種聲音的複雜文檔(例如,多數意見和異議的法律裁決)。Opus 足夠智能,能在基於推斷而非明確文本進行歸因時進行標記。
幾分鐘內開始使用
與許多需要複雜 Python 環境和 JSON 配置的開源 AI 工具不同,Token Saver 打包為單個 .mcpb 包。
從項目的 GitHub Releases 頁面下載 token-saver-ccr.mcpb。 打開 Claude Desktop -> 設置 -> 擴展 -> 安裝擴展。 啓用擴展,點擊配置,並選擇一個專用文件夾來存放參考 PDF。 在第一次提示時,選擇始終允許。 在選定文件夾之前,擴展不會運行,因為這一選擇同時服務於三個目的。 這個文件夾值得花點心思考慮。它設定了可讀取的邊界,讓你可以按名稱請求文件而無需輸入路徑,並且它是服務器在對話開始時向 Claude 顯示的列表。一個小型文件夾只包含你打算詢問的內容,效果比指向整個文檔目錄好得多。
關鍵要點
大幅降低成本:通過使用本地混合 RAG 僅將相關段落傳遞給 LLM,令牌成本降低高達 99%。對話越長,節省越多。 可驗證的準確性:由於 Token Saver 為每個檢索到的塊附帶了精確頁碼,你可以通過打開本地 PDF 立即驗證 Claude 的聲明。 絕對隱私:邊界是你的本地機器。你的專有數據永遠不會上傳到 AI 提供商的服務器。 無摩擦設置:無需 Python。一個簡單的 .mcpb 文件即可在 Claude Desktop 中立即運行。
查看 GitHub 倉庫。
參考資料:MCP Bundle 格式 | all-MiniLM-L6-v2 | pdfkb-mcp | wesleygriffin/pdfrag | 語料庫:Dobbs v. Jackson Women's Health Organization;Berkshire Hathaway 2023 年度報告