Datalab的Marker 2與MinerU、Docling和LiteParse對比:在olmOCR基準測試中得分76.0,吞吐量達MinerU的5倍
Datalab釋出了Marker 2,這是一個完全重寫的開源文件轉換管道。在olmOCR-bench基準測試中,其平衡模式得分76.0%,在單個B200 GPU上達到每秒2.9頁的吞吐量,是MinerU管道後端的5倍以上,同時在準確性和速度上均超越Docling。文章還對比了Marker 2與MinerU、Docling和LiteParse在效能、許可和用例方面的差異。
Datalab釋出了Marker 2,這是對其開源文件轉換管道的全面重寫。Marker可將PDF、影像、PPTX、DOCX、XLSX、HTML和EPUB檔案轉換為Markdown、JSON、HTML或分塊格式。Datalab團隊基於過去幾個月釋出的三個元件對其進行了重建:Surya OCR 2、一個2000萬引數的快速佈局模型,以及一個速度是之前3倍的重寫版pdftext。
主要成果來自Allen AI的第三方基準測試olmOCR-bench。Marker 2的平衡模式總體得分76.0%,在純數字PDF上得分83.5%。在單個B200 GPU上,它可持續每秒處理2.9頁。這比MinerU管道後端的吞吐量高出5倍以上,後者得分72.7%,每秒僅0.54頁。Docling在同一測試中得分50.3%,每秒2.1頁。
Marker 2的新特性:它提供三種轉換路徑而非一種:平衡模式(最高質量,GPU最佳)、快速模式(輕量級,降低成本)和停用OCR模式(純文本層提取,完全在CPU上執行)。此外,架構改進允許許多CPU工作執行緒共享單個Surya推理伺服器,從而實現吞吐量線性擴充套件。
在對比中,Marker 2平衡模式領先MinerU 76.0%對72.7%,吞吐量優勢顯著。與Docling相比,Marker 2在準確性和速度上均獲勝,但Docling在治理和格式廣度上具備優勢。LiteParse儘管速度極快,但在結構化文件上表現不佳。
許可方面存在明顯差異:Marker程式碼採用Apache 2.0,但權重使用修改後的AI Pubs OpenRAIL-M許可,商業使用需付費;MinerU在1000萬月活或2000萬美元月收入以下免費,商業服務需披露;Docling採用MIT許可;LiteParse開源,但LlamaParse提供付費雲路徑。
團隊強調,Marker 2是一個管道而非VLM,全頁VLM在掃描件和數學文件上仍更優。但Marker平衡模式將差距縮小到僅落後Gemini Flash 3.5 0.4分,且在純數字文件上超出後者。