跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

LiteParse 新增 Markdown 輸出功能

文章摘要

LiteParse 2.1 推出最快的開源無模型 PDF 轉 Markdown 管道,在三大基準測試中均取得領先成績,並支持多語言運行環境。

LiteParse 新增 Markdown 輸出功能
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

幾周前,我們發佈了 LiteParse 2.0,號稱最快的 PDF 轉文本工具。但用户反覆追問:基準測試在哪?是否支持 Markdown?

LiteParse 2.1 以最快的開源無模型 PDF 轉 Markdown 管道回答了這些問題。我們在三個標準基準上進行了測試,並在所有無模型方法中取得了最高總分:opendataloader-bench 0.875,olmOCR-bench 0.391,ParseBench 0.3279。

立即訪問演示網站(在瀏覽器中使用 WASM 運行)或安裝最新版本!

工作原理

構建 Markdown 啓發式管道主要分為兩部分:可檢測信號和監聽這些信號的輸出元素類型。與機器學習模型類似,這歸結為輸入、權重和激活!

PDF 攜帶大量數據:字體族、字號、文本位置等。所有這些都被視為輸入信號,將文本分類為特定的 Markdown 元素,如段落、表格、列表和標題。

LiteParse 使用自定義 PDFium 分支捕獲儘可能多的信號,並將其與現有網格投影算法結合,以純啓發式規則方法提供最佳 Markdown 輸出。

衡量 Markdown 性能

事實證明,Markdown 不僅是高度請求的輸出選項,而且沒有它很難對 PDF 解析工具進行基準測試。所有現有基準都強烈針對 Markdown 測量。通過構建此管道,我們不僅提供了新的輸出模式,還能衡量和提升整體提取質量。

本着“輕量”的精神,LiteParse 的 Markdown 模式儘可能輕快。這種方法優先考慮速度,但必須接受準確率的上限——我們不會比 LlamaParse 做得更好。

基準測試結果

ParseBench

LiteParse 在總體上領先。圖表和視覺接地列對所有無模型工具而言基本上是噪聲。LiteParse 在表格、內容忠實度和語義格式方面表現出色。

opendataloader-bench

LiteParse 在所有類別中領先,包括閲讀順序、表格結構和標題層級。

olmOCR-bench

LiteParse 在大多數類別中領先,在基線檢查、頁眉頁腳、多列和表格測試中表現強勁。舊掃描和數學分數較低,符合預期。

速度測試

LiteParse 平均每頁僅需 3.16 毫秒,遠快於其他工具。

許可證與可移植性

LiteParse 採用 Apache-2.0 許可證,支持四種運行環境,包括通過 WASM 在瀏覽器中原生運行。

關於 2.1 版範圍

這三個基準並不總是對“好”的 Markdown 達成一致。我們調整輸出以贏得一個基準會導致另一個基準倒退。因此,我們保持 2.1 版在三者之間平衡表現。

立即試用

LiteParse 無處不在,2.1 版現已可用。遵循文檔鏈接獲取源碼詳情。

展開要點與分析

文章情報

工程師進階

要點

  • LiteParse 2.1 實現純啓發式 PDF 轉 Markdown,無需 AI 模型。
  • 在 ParseBench、opendataloader-bench 和 olmOCR-bench 上整體得分最高。
  • 速度極快,平均每頁僅需 3.16 毫秒。
  • 採用 Apache-2.0 許可證,支持 Rust、Python、Node、WASM。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。