AI News HubLIVE
サイト内リライト4 分で読了

Datalab Marker v2 vs MinerU、Docling、Liteparse:ベンチマーク比較

Datalab はオープンソースの文書変換パイプラインを完全に書き直した Marker 2 をリリース。バランスモードは olmOCR-bench で 76.0% を達成し、B200 GPU 1 基で毎秒 2.9 ページのスループットを維持——MinerU のパイプラインバックエンドの 5 倍以上、Docling を精度と速度の両方で上回る。本記事ではベンチマーク、ライセンス、ユースケースにわたる比較を詳述する。

ソースMarkTechPost著者: Asif Razzaq

Datalab は Marker 2 をリリースしました。これは、オープンソースの文書変換パイプラインを完全に書き直したものです。Marker は PDF、画像、PPTX、DOCX、XLSX、HTML、EPUB ファイルを Markdown、JSON、HTML、またはチャンクに変換します。Datalab チームは、過去数ヶ月にわたってリリースされた 3 つのコンポーネント(Surya OCR 2、2000 万パラメータの高速レイアウトモデル、3 倍高速化された再構築版 pdftext)を中心にパイプラインを再構築しました。

主な結果は、Allen AI のサードパーティベンチマーク olmOCR-bench からのものです。Marker 2 のバランスモードは全体で 76.0%、デジタル生まれの PDF では 83.5% を記録しました。単一の B200 GPU で毎秒 2.9 ページのスループットを維持します。これは MinerU のパイプラインバックエンドの 5 倍以上で、MinerU は 72.7%、0.54 ページ/秒です。Docling は同じ条件で 50.3%、2.1 ページ/秒でした。

Marker 2 の新機能には 3 つの変換モードがあります。バランスモードは Surya VLM がレイアウトを処理し、埋め込みテキストが不十分な場合はページ全体を再 OCR します。最高品質で GPU に依存します。高速モードは軽量の rf-detr/onnx レイアウト検出器と pdftext を使用し、VLM の使用を最小限に抑え、コストを抑えます。OCR 無効モードは純粋なテキストレイヤー抽出で、完全に CPU 上で動作します。モードはデフォルトでデバイスを認識し、GPU ではバランス、CPU/MPS では高速を選択します。–mode で上書き可能です。完全な CPU サポートが 2 つ目の構造的変更です。高速 –disable_ocr は GPU も推論サーバーも必要とせず、2000 万パラメータのレイアウトモデルは CPU 上でカラム、テーブル、ヘッダーを読み取ります。

3 つ目の変更はアーキテクチャに関するもので、スループット向上の要因です。複数の軽量 CPU ワーカーが単一の Surya 推論サーバーを共有します。親プロセスはそれらの間で VLM 並行性を調整するため、スループットはプロセスごとの VRAM ではなくサーバー容量に応じてスケールします。Datalab は、バランスモードが同じハードウェア上で単一ストリームの約 0.3 ページ/秒に対して約 2.9 ページ/秒の持続スループットを達成すると報告しています。

アップグレード前の破壊的変更に注意:Python 3.10+ が必要。パッケージングが Poetry から uv に移行し、ビルドバックエンドは hatchling ですが、pip install marker-pdf は変更なし。構造化抽出コンバーターと抽出機能は削除され、Datalab はホスト型 API または –use_llm ワークフローを推奨しています。

比較において、olmOCR-bench は Ai2 によるもので、1,403 の PDF と約 8,400 の合格/不合格ユニットテストを含み、数式レンダリング、テーブル構造、読み順、ヘッダー/フッター、古いスキャンをカバーします。全体スコアは 8 カテゴリのマクロ平均です。スループットは単一 B200 ホストでの持続同時ページ/秒であり、単一ストリームのレイテンシではありません。これらすべてのスコアとスループット数値は Datalab 自身の実行によるもので、Marker リポジトリのオープンハーネスで再現可能です。

MinerU との比較:Marker バランスは 76.0% 対 72.7% でリード。デジタル生まれの文書ではほぼ同等:83.5% 対 83.3%。差はスループット:Marker バランスは 2.9 ページ/秒、MinerU は 0.54 ページ/秒で 5.4 倍の差。Marker 高速は 7.4 ページ/秒で MinerU の約 13.7 倍だが、スコアは 6.1 ポイント低い。MinerU には VLM バックエンドもあり、スコアは高いがこの表には含まれていない。

Docling との比較:最大の差。Marker バランスは全体で 76.0% 対 50.3%、デジタル生まれで 83.5% 対 64.0%、速度も 2.9 ページ/秒対 2.1 ページ/秒で上回る。Docling の強みはガバナンスとフォーマットの広さ:MIT ライセンス、IBM Research 発、LF AI & Data Foundation のプロジェクト、オーディオやメールフォーマットも入力可能。

LiteParse との比較:LiteParse は Rust 製の文書パーサーで、直接の競合ではない。CPU で OCR オフの場合、LiteParse は 22.4%、Marker の CPU 専用モードは 43.6%。しかし LiteParse は OCR オフで 1721 ページ/秒と、Marker の CPU モードの約 73 倍の速度を達成。Marker の高速 –disable_ocr は CPU 上で 2000 万パラメータのレイアウトモデルを実行するため、プレーンテキストダンプの 2 倍以上のスコアを出せる。LiteParse にはレイアウトモデルがなく、非線形コンテンツでは性能が低下する。

全ページ VLM 層との比較:Datalab は Marker がパイプラインであって VLM ではないと強調。彼らのホスト型 Chandra 2 は 85.8%、API 経由の Gemini Flash 3.5 は 76.4%。Ai2 の olmOCR 2 は 82.4%、dots.ocr 1.5 は 83.9%。スキャン、数式多いページ、最高精度を求める場合、VLM 層が依然として優位。しかし Marker のバランスモードは Gemini Flash 3.5 との差をわずか 0.4 ポイントに縮め、デジタル生まれ文書では 83.5% 対 79.1% で上回り、ページごとの API 呼び出しも不要。

カテゴリ別の動作:モードの選択はスコアだけでなく失敗パターンを変える。数式が鋭いエッジ:高速モードは PDF テキスト層から方程式を読み取るため、arXiv の数式は 83.9 から 23.4 に低下し、–disable_ocr は設計上 0.0。2 つの数式カテゴリ以外では、古いスキャンがどのモードでも最も弱く、最大 43.2%。

ライセンス面で 4 つのシステムは大きく異なります:Marker のコードは Apache 2.0、モデル重みは修正版 AI Pubs OpenRAIL-M ライセンス——研究、個人使用、資金調達/収益が 500 万ドル未満のスタートアップは無料、商用利用は有料ライセンスが必要。MinerU は Apache 2.0 ベースの MinerU オープンソースライセンスに変更、月間アクティブユーザー 1 億以上または月収 2000 万ドル以上で商用ライセンスが必要、オンラインサービスはその事実を開示する必要あり。Docling は MIT、モデルライセンスは個別に追跡。LiteParse はオープンソース、LlamaParse が有料クラウドパスとして提供。

主要なポイント:Marker 2 バランスは olmOCR-bench で 76.0%、スループット 2.9 ページ/秒(MinerU パイプラインの 5 倍以上)。Docling を精度と速度の両方で上回る。LiteParse は構造を犠牲に速度を追求。高速モードは CPU のみで 23.7 ページ/秒。ライセンス面では Docling が最も緩く、MinerU と Marker には商用制限あり。すべてのベンチマークとスループットデータは再現可能な harness に同梱。