Datalab Marker v2 vs MinerU、Docling 和 Liteparse:基準測試對比
Datalab 發佈了 Marker 2,這是一個完全重寫的開源文檔轉換管道。在 olmOCR-bench 基準測試中,平衡模式得分 76.0%,單塊 B200 GPU 上吞吐量達 2.9 頁/秒,是 MinerU 管道後端的 5 倍以上,同時準確率和速度均超過 Docling。本文詳細對比了 Marker 2 與 MinerU、Docling 和 LiteParse 的性能、許可證和適用場景。
Datalab 發佈了 Marker 2,這是其開源文檔轉換管道的完全重寫版本。Marker 可將 PDF、圖像、PPTX、DOCX、XLSX、HTML 和 EPUB 文件轉換為 Markdown、JSON、HTML 或分塊文本。Datalab 團隊圍繞此前數月發佈的三個組件重建了該管道:Surya OCR 2、一個 2000 萬參數的快速佈局模型,以及一個速度提升 3 倍的重構 pdftext。
主要結果來自 Allen AI 的第三方基準測試 olmOCR-bench。Marker 2 的平衡模式整體得分 76.0%,在純數字 PDF 上得分 83.5%。在單塊 B200 GPU 上,其持續吞吐量達到 2.9 頁/秒。這比 MinerU 管道後端的 5 倍以上(MinerU 得分 72.7%,速度 0.54 頁/秒)。在同一測試中,Docling 得分為 50.3%,速度為 2.1 頁/秒。
Marker 2 的新特性包括三種轉換模式:平衡模式(使用 Surya VLM 處理佈局,並在嵌入文本質量差時重新 OCR,質量最高,依賴 GPU)、快速模式(使用輕量級 rf-detr/onnx 佈局檢測器和 pdftext,極少使用 VLM,成本更低)以及禁用 OCR 模式(純文本層提取,完全在 CPU 上運行)。模式現在默認根據設備選擇:GPU 上使用平衡模式,CPU/MPS 上使用快速模式,可覆蓋。全面 CPU 支持是第二個結構性變化:快速禁用 OCR 模式無需 GPU 和推理服務器,2000 萬參數的佈局模型仍在 CPU 上讀取列、表格和標題。
第三個變化是架構性的,也是產生高吞吐量的原因:多個輕量級 CPU 工作進程共享一個 Surya 推理服務器。父進程在它們之間平衡 VLM 併發,因此吞吐量隨服務器容量擴展,而不是受限於每進程的 VRAM。Datalab 報告稱,平衡模式在相同硬件上持續吞吐量約為 2.9 頁/秒,而單流速率約為 0.3 頁/秒。
升級前需要注意一些重大變更:現在需要 Python 3.10+;打包從 Poetry 遷移到 uv,使用 hatchling 作為構建後端,但 pip install marker-pdf 保持不變;移除了結構化提取轉換器和提取器,Datalab 建議用户使用託管 API 或 –use_llm 工作流。
在對比中,olMOCR-bench 來自 Ai2,包含 1403 個 PDF 和約 8400 個通過/失敗單元測試,涵蓋數學渲染、表格結構、閲讀順序、頁眉頁腳和舊掃描。整體得分是 8 個類別的宏平均值。吞吐量是在單塊 B200 主機上的持續併發頁/秒,而非單流延遲。需要注意的是,所有這些分數和吞吐量數據均來自 Datalab 自己的運行,可通過 Marker 倉庫中的開源測試工具重現。
與 MinerU 相比,Marker 平衡模式領先 76.0% 對 72.7%。在純數字文檔上兩者幾乎持平:83.5% 對 83.3%。差距在於吞吐量:Marker 平衡模式 2.9 頁/秒對比 MinerU 的 0.54 頁/秒,差距達 5.4 倍。Marker 快速模式速度達 7.4 頁/秒,約為 MinerU 的 13.7 倍,但得分低 6.1 個百分點。MinerU 還有一個 VLM 後端,得分更高,但未包含在此表中。
與 Docling 相比,差距最大。Marker 平衡模式整體領先 76.0% 對 50.3%,純數字文檔 83.5% 對 64.0%,同時速度更快:2.9 頁/秒對 2.1 頁/秒。Docling 的優勢在於治理和格式廣度:MIT 許可證,源於 IBM 研究院,託管於 LF AI & Data 基金會,輸入格式包括音頻和電子郵件。
與 LiteParse 相比,LiteParse 是 Rust 編寫的文檔解析器,不直接競爭。在 CPU 上,關閉 OCR 時 LiteParse 得分 22.4%,Marker 的 CPU-only 模式得分 43.6%。但 LiteParse 關閉 OCR 後速度達 1721 頁/秒,約為 Marker CPU 模式的 73 倍。Marker 的快速禁用 OCR 模式在 CPU 上運行 2000 萬參數的佈局模型,因此得分是純文本轉儲的兩倍以上,而 LiteParse 沒有佈局模型,在非線性內容上表現不佳。
與全頁 VLM 層級相比,Datalab 強調 Marker 是管道而非 VLM。他們託管的 Chandra 2 得分 85.8%,Gemini Flash 3.5 通過 API 得分 76.4%。Ai2 的 olmOCR 2 得分 82.4%,dots.ocr 1.5 得分 83.9%。對於掃描件、數學密集頁面和最高準確率,VLM 層級仍然優於所有列出的管道。但 Marker 的平衡模式將性能差距縮小到僅落後 Gemini Flash 3.5 0.4 個百分點,並在純數字文檔上以 83.5% 對 79.1% 勝出,且無需每頁 API 調用。
按類別看,模式選擇改變失敗特徵。數學是尖鋭邊緣:快速模式從 PDF 文本層讀取方程式而非 VLM-OCR,因此 arXiv 數學從 83.9 降至 23.4,禁用 OCR 模式得分為 0.0。除數學外,舊掃描在每個模式中都是最弱項,最高 43.2%。
許可證方面,四個系統差異顯著:Marker 代碼為 Apache 2.0,模型權重使用修改後的 AI Pubs OpenRAIL-M 許可證——研究、個人使用和融資/收入低於 500 萬美元的初創公司免費,商業使用需付費。MinerU 現在使用基於 Apache 2.0 的 MinerU 開源許可證,月活躍用户超過 1 億或月收入超過 2000 萬美元需商業許可證,基於其構建的在線服務必須披露。Docling 是 MIT 許可證,模型許可證單獨追蹤。LiteParse 開源,LlamaParse 是付費雲路徑。
關鍵要點:Marker 2 平衡模式在 olmOCR-bench 上得分 76.0%,速度 2.9 頁/秒,是 MinerU 管道吞吐量的 5 倍以上;在準確率和速度上均擊敗 Docling;LiteParse 以結構換速度;快速模式可完全在 CPU 上運行,速度 23.7 頁/秒;許可證方面 Docling 最寬鬆,MinerU 和 Marker 有商業限制。所有基準測試和吞吐量數據均附帶可重現的測試工具。