AI News HubLIVE
站內改寫4 分鐘閱讀

Token Saver:開源MCP擴充套件,利用本地混合RAG將Claude PDF令牌成本削減90-99%

Token Saver 是一個開源的 MCP 擴充套件,透過本地混合 RAG 技術,在保證文件絕對隱私的同時,將 Claude Desktop 處理 PDF 的令牌消耗降低最多 99%。它無需 Python 環境,一鍵安裝即可使用。

來源MarkTechPost作者: Arnav Rai, Jean-marc Mommessin and Asif Razzaq

AI 開發人員、研究人員和專業人士在使用大型語言模型分析大型文件時,常常會遇到一個令人沮喪的問題:上下文視窗帶來的隱性且不斷累積的成本。將一份 200 頁的 PDF 貼上到聊天中並非一次性付費。由於對話歷史會在每次互動時重新傳送給模型,因此每提出一個後續問題,都需要為這份龐大文件再次付費。

Marktechpost AI 團隊剛剛釋出了 Token Saver,這是一個開源的模型上下文協議(MCP)擴充套件,適用於 Claude Desktop(MIT 許可,當前版本 v1.0)。它是由 Marktechpost AI Media Inc 的 Arnav Rai(羅切斯特理工學院電腦科學學生)在 Marktechpost 實習期間,在 Jean-marc Mommessin 和 Asif Razzaq 的指導下開發的。Token Saver 從根本上改變了 Claude 與本地文件的互動方式。透過在你的本地機器上直接實現本地混合 RAG 系統,你可以詢問關於大規模 PDF 的問題,而無需將實際檔案上傳到模型。

令牌消耗降低了 92% 到 99%,隱私得到了保障,並且安裝過程完全不需要任何 Python 環境或終端配置。

大型 PDF 的隱性令牌消耗

大多數使用者認為,當他們將 PDF 放入 Claude 時,它只是簡單地提取文本。實際上,Claude 的預設行為是將每一頁轉換為影像以保留圖表和佈局,同時單獨提取文本。在計算單個影像令牌之前,僅文本部分每頁就可能消耗 1,500 到 3,000 個令牌。

雖然 Prompt Caching 和 Claude Projects 有助於緩解這一問題,但它們並沒有解決核心問題:整個文件仍然需要跨越邊界傳輸到提供商的伺服器。此外,如果你只需要從一本 1000 頁的教科書中找到兩個相關段落,強制 LLM 搜尋整個 1000 頁既低效又容易產生幻覺。

本地混合 RAG 如何解決問題

Marktechpost 的 Token Saver 作為一個本地 MCP 伺服器執行:一個在你機器上執行的後臺輕量級程式,Claude 可以將其作為工具呼叫。PDF 永遠不會離開你的硬碟。

當你提出問題時,Token Saver 會利用本地混合 RAG 來查詢答案。混合 RAG 是文件檢索的黃金標準,因為它結合了兩種強大的搜尋方法:

關鍵詞匹配(BM25):利用 SQLite 內建的 FTS5 搜尋(權重 0.4)查詢精確術語。 語義搜尋(餘弦相似度):使用本地的 all-MiniLM-L6-v2 嵌入模型(權重 0.6)理解你問題的含義,而不僅僅是匹配精確詞語。 透過這兩種方法本地結合,伺服器搜尋檔案並向 Claude 僅提供高度相關的段落。然後 Claude 綜合答案,引用精確頁碼,並提供你剛剛節省的令牌數的即時統計。

8 階段處理流程

Token Saver 完全在一個單一的、長時間執行的本地程序內執行。在任何文本到達 Claude 之前,本地混合 RAG 流程執行八個快速步驟:

提取:使用 pypdfium2(備選 pypdf)提取文本。 分塊:將文本分割成 180 個單詞的段落,重疊 40 個單詞,以確保上下文不被盲目切斷。 評分(混合 RAG):使用混合的 BM25 和本地嵌入模型評估塊。 門控:強制執行質量閾值。沒有共享關鍵詞的段落必須透過 0.25 的語義相似度下限才有資格。 去重:丟棄幾乎相同的段落。 修剪:將段落嚴格縮小到回答使用者提示的句子。 預算:將傳送給 Claude 的總負載限制在 8,000 個字元。 封裝:將檢索到的文本包裝在包含原始檔和精確頁碼的文件塊元素中。 (注意:嵌入模型是可選的但推薦使用。如果載入失敗,系統會優雅地回退到僅關鍵詞匹配)。

資料:規模化節省 99%

由於混合 RAG 流程限制了返回的文本切片,令牌節省隨文件大小呈指數增長。以下是 Token Saver 在基準測試中的表現(透過 tiktoken 測量,假設每份文件一個問題):

文件 頁數 全文令牌數 返回令牌數 節省百分比 FDA 藥品標籤 33 23,959 1,021 95.7% GDPR(EU 2016/679) 88 70,260 996 98.6% SFFA v. Harvard 233 133,349 740 99.4%

免責宣告:令牌計數使用 cl100k_base 作為替代,基線假設每次搜尋都按整個文件計費。

對於經常處理法院意見、技術標準、財務報告或密集教科書的專業人士來說,Token Saver 消除了重複的令牌稅。

安全與本地隱私

對於企業使用者和法律專業人士而言,資料隱私是不可談判的。Token Saver 的安全模型基於三個支柱:

零上傳:文件從不離開你的機器。 資料夾白名單:你為 Token Saver 配置一個特定資料夾。伺服器會主動拒絕讀取此指定目錄之外的檔案。 網路隔離:伺服器僅透過標準 I/O(stdio)與 Claude Desktop 通訊。沒有監聽網路埠,大大減少了攻擊面。

模型效能:Sonnet vs. Opus

Marktechpost 的 Token Saver 在所有三個 Claude 3.5 層級上都能工作,但測試揭示了不同的行為:

Claude 3.5 Sonnet(推薦):合理的預設選項。它能完美處理鬆散的檔案引用,如果兩個檔名相似會提出澄清性問題,並正確應用檢索到的頁碼。 Claude 3 Opus:擅長處理包含多種聲音的複雜文件(例如,多數意見和異議的法律裁決)。Opus 足夠智慧,能在基於推斷而非明確文本進行歸因時進行標記。

幾分鐘內開始使用

與許多需要複雜 Python 環境和 JSON 配置的開源 AI 工具不同,Token Saver 打包為單個 .mcpb 包。

從專案的 GitHub Releases 頁面下載 token-saver-ccr.mcpb。 開啟 Claude Desktop -> 設定 -> 擴充套件 -> 安裝擴充套件。 啟用擴充套件,點選配置,並選擇一個專用資料夾來存放參考 PDF。 在第一次提示時,選擇始終允許。 在選定資料夾之前,擴充套件不會執行,因為這一選擇同時服務於三個目的。 這個資料夾值得花點心思考慮。它設定了可讀取的邊界,讓你可以按名稱請求檔案而無需輸入路徑,並且它是伺服器在對話開始時向 Claude 顯示的列表。一個小型資料夾只包含你打算詢問的內容,效果比指向整個文件目錄好得多。

關鍵要點

大幅降低成本:透過使用本地混合 RAG 僅將相關段落傳遞給 LLM,令牌成本降低高達 99%。對話越長,節省越多。 可驗證的準確性:由於 Token Saver 為每個檢索到的塊附帶了精確頁碼,你可以透過開啟本地 PDF 立即驗證 Claude 的宣告。 絕對隱私:邊界是你的本地機器。你的專有資料永遠不會上傳到 AI 提供商的伺服器。 無摩擦設定:無需 Python。一個簡單的 .mcpb 檔案即可在 Claude Desktop 中立即執行。

檢視 GitHub 倉庫。

參考資料:MCP Bundle 格式 | all-MiniLM-L6-v2 | pdfkb-mcp | wesleygriffin/pdfrag | 語料庫:Dobbs v. Jackson Women's Health Organization;Berkshire Hathaway 2023 年度報告