数週間前、私たちは LiteParse 2.0 を最速のPDFテキスト変換ツールとしてリリースしました。しかし、ベンチマークは?Markdown 出力は?という質問が繰り返し寄せられました。
LiteParse 2.1 は、最速のオープンソース・モデルフリー PDF→Markdown パイプラインで答えを提供します。3つの標準ベンチマークで測定した結果、モデルフリーアプローチの中で全体的に最高スコアを達成しました:opendataloader-bench 0.875、olmOCR-bench 0.391、ParseBench 0.3279。
デモサイト(ブラウザ内 WASM で動作)にアクセスするか、最新版をインストールしてください!
仕組み
Markdown のヒューリスティックパイプラインの構築は、基本的に検出可能な信号と、それらの信号をリッスンする出力要素の2つに分けられます。機械学習モデルと同様に、入力、重み、活性化関数に集約されます。
PDF にはフォントファミリー、フォントサイズ、テキスト位置など多くのデータが含まれています。これらすべてが入力信号として扱われ、テキストを段落、表、リスト、ヘッダーなどの特定の Markdown 要素に分類します。
LiteParse はカスタム PDFium フォークを使用して可能な限り多くの信号を捉え、既存のグリッド投影アルゴリズムからの信号と組み合わせて、純粋なヒューリスティックルールベースのアプローチで最高の Markdown 出力を提供します。
Markdown 性能の測定
Markdown は非常に要望の多い出力オプションであるだけでなく、それなしでは PDF 解析ツールのベンチマークが非常に困難であることがわかりました。
既存のベンチマーク(ParseBench、olmOCR-bench、opendataloader-bench)はすべて Markdown 測定に強く適合しています。このパイプラインを構築することで、まったく新しい出力モードを提供すると同時に、抽出品質全体を測定・改善できるようになりました。
「軽量」の精神に則り、LiteParse の Markdown モードは可能な限り軽量かつ高速に構築されています。このアプローチは速度を優先しますが、正確さに上限があることを受け入れなければなりません(このアプローチでは LlamaParse より良くはなりません)。
ベンチマーク結果
ParseBench
LiteParse が総合でリードしています。グラフとビジュアルグラウンディングの列は、すべてのモデルフリーツールにとって実質的にノイズです。LiteParse はテーブル、コンテンツの忠実度、セマンティックフォーマットで優れたスコアを出しています。
opendataloader-bench
LiteParse は読取順序、テーブル構造、見出しレベルの全カテゴリでリードしています。
olmOCR-bench
LiteParse はほとんどのカテゴリでリードし、ベースラインチェック、ヘッダー/フッター、マルチカラム、テーブルテストで好成績を収めています。古いスキャンや数学のスコアが低いのは予想通りです。
速度テスト
LiteParse は平均 3.16 ミリ秒/ページと、他のツールよりはるかに高速です。
ライセンスと移植性
LiteParse は Apache-2.0 ライセンスで、Rust、Python、Node、WASM の4つのエコシステムを単一エンジンでサポートします。
v2.1 の範囲について
これら3つのベンチマークは「良い」Markdown の定義で必ずしも一致しません。私たちは v2.1 を三者間でバランスの取れた性能に調整しました。
今すぐ試す
LiteParse はどこでも動作し、v2.1 が利用可能です。詳細はドキュメントとソースコードをご覧ください。