DocOCR-Eval:一種基於校正的無真實標註OCR工具選擇框架
本文提出DocOCR-Eval,一種無需人工標註的評估框架,用於自動評估和選擇OCR工具。該框架通過三階段校正和排序策略,在缺乏真實標籤的情況下近似基於標註的工具排序。實驗表明,聚合多個多模態大語言模型可逐步提升與人工標註排序的一致性,為實際部署文檔解析系統提供指導。
文檔解析是視覺問答和關鍵信息提取等文檔理解任務的基礎步驟,它將非結構化的掃描圖像轉換為結構化表示,提取文本、視覺和佈局信息。儘管已有大量光學字符識別(OCR)引擎和多模態大語言模型(MLLM)被開發用於此目的,但在給定文檔集合中選擇合適的文檔解析方案仍然具有挑戰性,尤其是在標籤稀缺的情況下。
在這項工作中,研究者對多種OCR引擎和先進MLLM在多個跨領域、跨語言的掃描文檔基準上進行了系統性的文本識別性能評估。這些基準涵蓋了不同的文檔類型和語言,旨在全面衡量各種工具的真實能力。鑑於許多OCR引擎的上下文推理能力有限且手動標註成本高昂,他們提出了DocOCR-Eval——一種無需標註的自動評估框架。
DocOCR-Eval的核心是一個三階段校正與排序策略。首先,框架使用多個MLLM對OCR輸出進行初步校正;然後,基於校正後的結果進行一致性評估;最後,通過排序算法聚合多個模型的輸出,以近似基於人工標註的排序結果。這種方法無需真實標籤,僅依賴模型間的相互驗證。
實驗中,研究者系統性地比較了多種OCR引擎和MLLM的性能。結果表明,聚合多個MLLM的結果能夠逐步提升與人工標註排序的一致性,而且這種提升隨着模型數量的增加而更加明顯。此外,在現實的標籤受限環境中,該框架也能實現可靠的OCR工具選擇,為不同真實文檔集合中的文檔解析系統部署提供了實用指導。
該工作為解決缺乏人工標註時的OCR工具評估和選擇問題提供了新思路,有望大幅降低文檔處理系統的部署成本,並推動更智能的文檔理解系統的發展。論文由Zihan Xu等六位作者完成,於2026年5月5日提交至arXiv,屬於進行中的工作。