幾周前,我們釋出了 LiteParse 2.0,號稱最快的 PDF 轉文本工具。但使用者反覆追問:基準測試在哪?是否支援 Markdown?
LiteParse 2.1 以最快的開源無模型 PDF 轉 Markdown 管道回答了這些問題。我們在三個標準基準上進行了測試,並在所有無模型方法中取得了最高總分:opendataloader-bench 0.875,olmOCR-bench 0.391,ParseBench 0.3279。
立即訪問演示網站(在瀏覽器中使用 WASM 執行)或安裝最新版本!
工作原理
構建 Markdown 啟發式管道主要分為兩部分:可檢測訊號和監聽這些訊號的輸出元素型別。與機器學習模型類似,這歸結為輸入、權重和啟用!
PDF 攜帶大量資料:字型族、字號、文本位置等。所有這些都被視為輸入訊號,將文本分類為特定的 Markdown 元素,如段落、表格、列表和標題。
LiteParse 使用自定義 PDFium 分支捕獲儘可能多的訊號,並將其與現有網格投影演算法結合,以純啟發式規則方法提供最佳 Markdown 輸出。
衡量 Markdown 效能
事實證明,Markdown 不僅是高度請求的輸出選項,而且沒有它很難對 PDF 解析工具進行基準測試。所有現有基準都強烈針對 Markdown 測量。透過構建此管道,我們不僅提供了新的輸出模式,還能衡量和提升整體提取質量。
本著“輕量”的精神,LiteParse 的 Markdown 模式儘可能輕快。這種方法優先考慮速度,但必須接受準確率的上限——我們不會比 LlamaParse 做得更好。
基準測試結果
ParseBench
LiteParse 在總體上領先。圖表和視覺接地列對所有無模型工具而言基本上是噪聲。LiteParse 在表格、內容忠實度和語義格式方面表現出色。
opendataloader-bench
LiteParse 在所有類別中領先,包括閱讀順序、表格結構和標題層級。
olmOCR-bench
LiteParse 在大多數類別中領先,在基線檢查、頁首頁尾、多列和表格測試中表現強勁。舊掃描和數學分數較低,符合預期。
速度測試
LiteParse 平均每頁僅需 3.16 毫秒,遠快於其他工具。
許可證與可移植性
LiteParse 採用 Apache-2.0 許可證,支援四種執行環境,包括透過 WASM 在瀏覽器中原生執行。
關於 2.1 版範圍
這三個基準並不總是對“好”的 Markdown 達成一致。我們調整輸出以贏得一個基準會導致另一個基準倒退。因此,我們保持 2.1 版在三者之間平衡表現。
立即試用
LiteParse 無處不在,2.1 版現已可用。遵循文件連結獲取原始碼詳情。