Datalab的Marker 2与MinerU、Docling和LiteParse对比:在olmOCR基准测试中得分76.0,吞吐量达MinerU的5倍
Datalab发布了Marker 2,这是一个完全重写的开源文档转换管道。在olmOCR-bench基准测试中,其平衡模式得分76.0%,在单个B200 GPU上达到每秒2.9页的吞吐量,是MinerU管道后端的5倍以上,同时在准确性和速度上均超越Docling。文章还对比了Marker 2与MinerU、Docling和LiteParse在性能、许可和用例方面的差异。
Datalab发布了Marker 2,这是对其开源文档转换管道的全面重写。Marker可将PDF、图像、PPTX、DOCX、XLSX、HTML和EPUB文件转换为Markdown、JSON、HTML或分块格式。Datalab团队基于过去几个月发布的三个组件对其进行了重建:Surya OCR 2、一个2000万参数的快速布局模型,以及一个速度是之前3倍的重写版pdftext。
主要成果来自Allen AI的第三方基准测试olmOCR-bench。Marker 2的平衡模式总体得分76.0%,在纯数字PDF上得分83.5%。在单个B200 GPU上,它可持续每秒处理2.9页。这比MinerU管道后端的吞吐量高出5倍以上,后者得分72.7%,每秒仅0.54页。Docling在同一测试中得分50.3%,每秒2.1页。
Marker 2的新特性:它提供三种转换路径而非一种:平衡模式(最高质量,GPU最佳)、快速模式(轻量级,降低成本)和禁用OCR模式(纯文本层提取,完全在CPU上运行)。此外,架构改进允许许多CPU工作线程共享单个Surya推理服务器,从而实现吞吐量线性扩展。
在对比中,Marker 2平衡模式领先MinerU 76.0%对72.7%,吞吐量优势显著。与Docling相比,Marker 2在准确性和速度上均获胜,但Docling在治理和格式广度上具备优势。LiteParse尽管速度极快,但在结构化文档上表现不佳。
许可方面存在明显差异:Marker代码采用Apache 2.0,但权重使用修改后的AI Pubs OpenRAIL-M许可,商业使用需付费;MinerU在1000万月活或2000万美元月收入以下免费,商业服务需披露;Docling采用MIT许可;LiteParse开源,但LlamaParse提供付费云路径。
团队强调,Marker 2是一个管道而非VLM,全页VLM在扫描件和数学文档上仍更优。但Marker平衡模式将差距缩小到仅落后Gemini Flash 3.5 0.4分,且在纯数字文档上超出后者。