AI News HubLIVE
站內改寫1 分鐘閱讀

DocOCR-Eval:一種基於校正的無真實標註OCR工具選擇框架

本文提出DocOCR-Eval,一種無需人工標註的評估框架,用於自動評估和選擇OCR工具。該框架透過三階段校正和排序策略,在缺乏真實標籤的情況下近似基於標註的工具排序。實驗表明,聚合多個多模態大語言模型可逐步提升與人工標註排序的一致性,為實際部署文件解析系統提供指導。

來源arXiv Machine Learning作者: Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

文件解析是視覺問答和關鍵資訊提取等文件理解任務的基礎步驟,它將非結構化的掃描影像轉換為結構化表示,提取文本、視覺和佈局資訊。儘管已有大量光學字元識別(OCR)引擎和多模態大語言模型(MLLM)被開發用於此目的,但在給定文件集合中選擇合適的文件解析方案仍然具有挑戰性,尤其是在標籤稀缺的情況下。

在這項工作中,研究者對多種OCR引擎和先進MLLM在多個跨領域、跨語言的掃描文件基準上進行了系統性的文本識別效能評估。這些基準涵蓋了不同的文件型別和語言,旨在全面衡量各種工具的真實能力。鑑於許多OCR引擎的上下文推理能力有限且手動標註成本高昂,他們提出了DocOCR-Eval——一種無需標註的自動評估框架。

DocOCR-Eval的核心是一個三階段校正與排序策略。首先,框架使用多個MLLM對OCR輸出進行初步校正;然後,基於校正後的結果進行一致性評估;最後,透過排序演算法聚合多個模型的輸出,以近似基於人工標註的排序結果。這種方法無需真實標籤,僅依賴模型間的相互驗證。

實驗中,研究者系統性地比較了多種OCR引擎和MLLM的效能。結果表明,聚合多個MLLM的結果能夠逐步提升與人工標註排序的一致性,而且這種提升隨著模型數量的增加而更加明顯。此外,在現實的標籤受限環境中,該框架也能實現可靠的OCR工具選擇,為不同真實文件集合中的文件解析系統部署提供了實用指導。

該工作為解決缺乏人工標註時的OCR工具評估和選擇問題提供了新思路,有望大幅降低文件處理系統的部署成本,並推動更智慧的文件理解系統的發展。論文由Zihan Xu等六位作者完成,於2026年5月5日提交至arXiv,屬於進行中的工作。