Datalab Marker v2 vs MinerU、Docling 和 Liteparse:基准测试对比
Datalab 发布了 Marker 2,这是一个完全重写的开源文档转换管道。在 olmOCR-bench 基准测试中,平衡模式得分 76.0%,单块 B200 GPU 上吞吐量达 2.9 页/秒,是 MinerU 管道后端的 5 倍以上,同时准确率和速度均超过 Docling。本文详细对比了 Marker 2 与 MinerU、Docling 和 LiteParse 的性能、许可证和适用场景。
Datalab 发布了 Marker 2,这是其开源文档转换管道的完全重写版本。Marker 可将 PDF、图像、PPTX、DOCX、XLSX、HTML 和 EPUB 文件转换为 Markdown、JSON、HTML 或分块文本。Datalab 团队围绕此前数月发布的三个组件重建了该管道:Surya OCR 2、一个 2000 万参数的快速布局模型,以及一个速度提升 3 倍的重构 pdftext。
主要结果来自 Allen AI 的第三方基准测试 olmOCR-bench。Marker 2 的平衡模式整体得分 76.0%,在纯数字 PDF 上得分 83.5%。在单块 B200 GPU 上,其持续吞吐量达到 2.9 页/秒。这比 MinerU 管道后端的 5 倍以上(MinerU 得分 72.7%,速度 0.54 页/秒)。在同一测试中,Docling 得分为 50.3%,速度为 2.1 页/秒。
Marker 2 的新特性包括三种转换模式:平衡模式(使用 Surya VLM 处理布局,并在嵌入文本质量差时重新 OCR,质量最高,依赖 GPU)、快速模式(使用轻量级 rf-detr/onnx 布局检测器和 pdftext,极少使用 VLM,成本更低)以及禁用 OCR 模式(纯文本层提取,完全在 CPU 上运行)。模式现在默认根据设备选择:GPU 上使用平衡模式,CPU/MPS 上使用快速模式,可覆盖。全面 CPU 支持是第二个结构性变化:快速禁用 OCR 模式无需 GPU 和推理服务器,2000 万参数的布局模型仍在 CPU 上读取列、表格和标题。
第三个变化是架构性的,也是产生高吞吐量的原因:多个轻量级 CPU 工作进程共享一个 Surya 推理服务器。父进程在它们之间平衡 VLM 并发,因此吞吐量随服务器容量扩展,而不是受限于每进程的 VRAM。Datalab 报告称,平衡模式在相同硬件上持续吞吐量约为 2.9 页/秒,而单流速率约为 0.3 页/秒。
升级前需要注意一些重大变更:现在需要 Python 3.10+;打包从 Poetry 迁移到 uv,使用 hatchling 作为构建后端,但 pip install marker-pdf 保持不变;移除了结构化提取转换器和提取器,Datalab 建议用户使用托管 API 或 –use_llm 工作流。
在对比中,olMOCR-bench 来自 Ai2,包含 1403 个 PDF 和约 8400 个通过/失败单元测试,涵盖数学渲染、表格结构、阅读顺序、页眉页脚和旧扫描。整体得分是 8 个类别的宏平均值。吞吐量是在单块 B200 主机上的持续并发页/秒,而非单流延迟。需要注意的是,所有这些分数和吞吐量数据均来自 Datalab 自己的运行,可通过 Marker 仓库中的开源测试工具重现。
与 MinerU 相比,Marker 平衡模式领先 76.0% 对 72.7%。在纯数字文档上两者几乎持平:83.5% 对 83.3%。差距在于吞吐量:Marker 平衡模式 2.9 页/秒对比 MinerU 的 0.54 页/秒,差距达 5.4 倍。Marker 快速模式速度达 7.4 页/秒,约为 MinerU 的 13.7 倍,但得分低 6.1 个百分点。MinerU 还有一个 VLM 后端,得分更高,但未包含在此表中。
与 Docling 相比,差距最大。Marker 平衡模式整体领先 76.0% 对 50.3%,纯数字文档 83.5% 对 64.0%,同时速度更快:2.9 页/秒对 2.1 页/秒。Docling 的优势在于治理和格式广度:MIT 许可证,源于 IBM 研究院,托管于 LF AI & Data 基金会,输入格式包括音频和电子邮件。
与 LiteParse 相比,LiteParse 是 Rust 编写的文档解析器,不直接竞争。在 CPU 上,关闭 OCR 时 LiteParse 得分 22.4%,Marker 的 CPU-only 模式得分 43.6%。但 LiteParse 关闭 OCR 后速度达 1721 页/秒,约为 Marker CPU 模式的 73 倍。Marker 的快速禁用 OCR 模式在 CPU 上运行 2000 万参数的布局模型,因此得分是纯文本转储的两倍以上,而 LiteParse 没有布局模型,在非线性内容上表现不佳。
与全页 VLM 层级相比,Datalab 强调 Marker 是管道而非 VLM。他们托管的 Chandra 2 得分 85.8%,Gemini Flash 3.5 通过 API 得分 76.4%。Ai2 的 olmOCR 2 得分 82.4%,dots.ocr 1.5 得分 83.9%。对于扫描件、数学密集页面和最高准确率,VLM 层级仍然优于所有列出的管道。但 Marker 的平衡模式将性能差距缩小到仅落后 Gemini Flash 3.5 0.4 个百分点,并在纯数字文档上以 83.5% 对 79.1% 胜出,且无需每页 API 调用。
按类别看,模式选择改变失败特征。数学是尖锐边缘:快速模式从 PDF 文本层读取方程式而非 VLM-OCR,因此 arXiv 数学从 83.9 降至 23.4,禁用 OCR 模式得分为 0.0。除数学外,旧扫描在每个模式中都是最弱项,最高 43.2%。
许可证方面,四个系统差异显著:Marker 代码为 Apache 2.0,模型权重使用修改后的 AI Pubs OpenRAIL-M 许可证——研究、个人使用和融资/收入低于 500 万美元的初创公司免费,商业使用需付费。MinerU 现在使用基于 Apache 2.0 的 MinerU 开源许可证,月活跃用户超过 1 亿或月收入超过 2000 万美元需商业许可证,基于其构建的在线服务必须披露。Docling 是 MIT 许可证,模型许可证单独追踪。LiteParse 开源,LlamaParse 是付费云路径。
关键要点:Marker 2 平衡模式在 olmOCR-bench 上得分 76.0%,速度 2.9 页/秒,是 MinerU 管道吞吐量的 5 倍以上;在准确率和速度上均击败 Docling;LiteParse 以结构换速度;快速模式可完全在 CPU 上运行,速度 23.7 页/秒;许可证方面 Docling 最宽松,MinerU 和 Marker 有商业限制。所有基准测试和吞吐量数据均附带可重现的测试工具。