Datalab Marker v2 vs MinerU、Docling 和 Liteparse:基準測試對比
Datalab 釋出了 Marker 2,這是一個完全重寫的開源文件轉換管道。在 olmOCR-bench 基準測試中,平衡模式得分 76.0%,單塊 B200 GPU 上吞吐量達 2.9 頁/秒,是 MinerU 管道後端的 5 倍以上,同時準確率和速度均超過 Docling。本文詳細對比了 Marker 2 與 MinerU、Docling 和 LiteParse 的效能、許可證和適用場景。
Datalab 釋出了 Marker 2,這是其開源文件轉換管道的完全重寫版本。Marker 可將 PDF、影像、PPTX、DOCX、XLSX、HTML 和 EPUB 檔案轉換為 Markdown、JSON、HTML 或分塊文本。Datalab 團隊圍繞此前數月釋出的三個元件重建了該管道:Surya OCR 2、一個 2000 萬引數的快速佈局模型,以及一個速度提升 3 倍的重構 pdftext。
主要結果來自 Allen AI 的第三方基準測試 olmOCR-bench。Marker 2 的平衡模式整體得分 76.0%,在純數字 PDF 上得分 83.5%。在單塊 B200 GPU 上,其持續吞吐量達到 2.9 頁/秒。這比 MinerU 管道後端的 5 倍以上(MinerU 得分 72.7%,速度 0.54 頁/秒)。在同一測試中,Docling 得分為 50.3%,速度為 2.1 頁/秒。
Marker 2 的新特性包括三種轉換模式:平衡模式(使用 Surya VLM 處理佈局,並在嵌入文本質量差時重新 OCR,質量最高,依賴 GPU)、快速模式(使用輕量級 rf-detr/onnx 佈局檢測器和 pdftext,極少使用 VLM,成本更低)以及停用 OCR 模式(純文本層提取,完全在 CPU 上執行)。模式現在預設根據裝置選擇:GPU 上使用平衡模式,CPU/MPS 上使用快速模式,可覆蓋。全面 CPU 支援是第二個結構性變化:快速停用 OCR 模式無需 GPU 和推理伺服器,2000 萬引數的佈局模型仍在 CPU 上讀取列、表格和標題。
第三個變化是架構性的,也是產生高吞吐量的原因:多個輕量級 CPU 工作程序共享一個 Surya 推理伺服器。父程序在它們之間平衡 VLM 併發,因此吞吐量隨伺服器容量擴充套件,而不是受限於每程序的 VRAM。Datalab 報告稱,平衡模式在相同硬體上持續吞吐量約為 2.9 頁/秒,而單流速率約為 0.3 頁/秒。
升級前需要注意一些重大變更:現在需要 Python 3.10+;打包從 Poetry 遷移到 uv,使用 hatchling 作為構建後端,但 pip install marker-pdf 保持不變;移除了結構化提取轉換器和提取器,Datalab 建議使用者使用託管 API 或 –use_llm 工作流。
在對比中,olMOCR-bench 來自 Ai2,包含 1403 個 PDF 和約 8400 個透過/失敗單元測試,涵蓋數學渲染、表格結構、閱讀順序、頁首頁尾和舊掃描。整體得分是 8 個類別的宏平均值。吞吐量是在單塊 B200 主機上的持續併發頁/秒,而非單流延遲。需要注意的是,所有這些分數和吞吐量資料均來自 Datalab 自己的執行,可透過 Marker 倉庫中的開源測試工具重現。
與 MinerU 相比,Marker 平衡模式領先 76.0% 對 72.7%。在純數字文件上兩者幾乎持平:83.5% 對 83.3%。差距在於吞吐量:Marker 平衡模式 2.9 頁/秒對比 MinerU 的 0.54 頁/秒,差距達 5.4 倍。Marker 快速模式速度達 7.4 頁/秒,約為 MinerU 的 13.7 倍,但得分低 6.1 個百分點。MinerU 還有一個 VLM 後端,得分更高,但未包含在此表中。
與 Docling 相比,差距最大。Marker 平衡模式整體領先 76.0% 對 50.3%,純數字文件 83.5% 對 64.0%,同時速度更快:2.9 頁/秒對 2.1 頁/秒。Docling 的優勢在於治理和格式廣度:MIT 許可證,源於 IBM 研究院,託管於 LF AI & Data 基金會,輸入格式包括音訊和電子郵件。
與 LiteParse 相比,LiteParse 是 Rust 編寫的文件解析器,不直接競爭。在 CPU 上,關閉 OCR 時 LiteParse 得分 22.4%,Marker 的 CPU-only 模式得分 43.6%。但 LiteParse 關閉 OCR 後速度達 1721 頁/秒,約為 Marker CPU 模式的 73 倍。Marker 的快速停用 OCR 模式在 CPU 上執行 2000 萬引數的佈局模型,因此得分是純文本轉儲的兩倍以上,而 LiteParse 沒有佈局模型,在非線性內容上表現不佳。
與全頁 VLM 層級相比,Datalab 強調 Marker 是管道而非 VLM。他們託管的 Chandra 2 得分 85.8%,Gemini Flash 3.5 透過 API 得分 76.4%。Ai2 的 olmOCR 2 得分 82.4%,dots.ocr 1.5 得分 83.9%。對於掃描件、數學密集頁面和最高準確率,VLM 層級仍然優於所有列出的管道。但 Marker 的平衡模式將效能差距縮小到僅落後 Gemini Flash 3.5 0.4 個百分點,並在純數字文件上以 83.5% 對 79.1% 勝出,且無需每頁 API 呼叫。
按類別看,模式選擇改變失敗特徵。數學是尖銳邊緣:快速模式從 PDF 文本層讀取方程式而非 VLM-OCR,因此 arXiv 數學從 83.9 降至 23.4,停用 OCR 模式得分為 0.0。除數學外,舊掃描在每個模式中都是最弱項,最高 43.2%。
許可證方面,四個系統差異顯著:Marker 程式碼為 Apache 2.0,模型權重使用修改後的 AI Pubs OpenRAIL-M 許可證——研究、個人使用和融資/收入低於 500 萬美元的初創公司免費,商業使用需付費。MinerU 現在使用基於 Apache 2.0 的 MinerU 開源許可證,月活躍使用者超過 1 億或月收入超過 2000 萬美元需商業許可證,基於其構建的線上服務必須披露。Docling 是 MIT 許可證,模型許可證單獨追蹤。LiteParse 開源,LlamaParse 是付費雲路徑。
關鍵要點:Marker 2 平衡模式在 olmOCR-bench 上得分 76.0%,速度 2.9 頁/秒,是 MinerU 管道吞吐量的 5 倍以上;在準確率和速度上均擊敗 Docling;LiteParse 以結構換速度;快速模式可完全在 CPU 上執行,速度 23.7 頁/秒;許可證方面 Docling 最寬鬆,MinerU 和 Marker 有商業限制。所有基準測試和吞吐量資料均附帶可重現的測試工具。