幾周前,我們發佈了 LiteParse 2.0,號稱最快的 PDF 轉文本工具。但用户反覆追問:基準測試在哪?是否支持 Markdown?
LiteParse 2.1 以最快的開源無模型 PDF 轉 Markdown 管道回答了這些問題。我們在三個標準基準上進行了測試,並在所有無模型方法中取得了最高總分:opendataloader-bench 0.875,olmOCR-bench 0.391,ParseBench 0.3279。
立即訪問演示網站(在瀏覽器中使用 WASM 運行)或安裝最新版本!
工作原理
構建 Markdown 啓發式管道主要分為兩部分:可檢測信號和監聽這些信號的輸出元素類型。與機器學習模型類似,這歸結為輸入、權重和激活!
PDF 攜帶大量數據:字體族、字號、文本位置等。所有這些都被視為輸入信號,將文本分類為特定的 Markdown 元素,如段落、表格、列表和標題。
LiteParse 使用自定義 PDFium 分支捕獲儘可能多的信號,並將其與現有網格投影算法結合,以純啓發式規則方法提供最佳 Markdown 輸出。
衡量 Markdown 性能
事實證明,Markdown 不僅是高度請求的輸出選項,而且沒有它很難對 PDF 解析工具進行基準測試。所有現有基準都強烈針對 Markdown 測量。通過構建此管道,我們不僅提供了新的輸出模式,還能衡量和提升整體提取質量。
本着“輕量”的精神,LiteParse 的 Markdown 模式儘可能輕快。這種方法優先考慮速度,但必須接受準確率的上限——我們不會比 LlamaParse 做得更好。
基準測試結果
ParseBench
LiteParse 在總體上領先。圖表和視覺接地列對所有無模型工具而言基本上是噪聲。LiteParse 在表格、內容忠實度和語義格式方面表現出色。
opendataloader-bench
LiteParse 在所有類別中領先,包括閲讀順序、表格結構和標題層級。
olmOCR-bench
LiteParse 在大多數類別中領先,在基線檢查、頁眉頁腳、多列和表格測試中表現強勁。舊掃描和數學分數較低,符合預期。
速度測試
LiteParse 平均每頁僅需 3.16 毫秒,遠快於其他工具。
許可證與可移植性
LiteParse 採用 Apache-2.0 許可證,支持四種運行環境,包括通過 WASM 在瀏覽器中原生運行。
關於 2.1 版範圍
這三個基準並不總是對“好”的 Markdown 達成一致。我們調整輸出以贏得一個基準會導致另一個基準倒退。因此,我們保持 2.1 版在三者之間平衡表現。
立即試用
LiteParse 無處不在,2.1 版現已可用。遵循文檔鏈接獲取源碼詳情。