AI News HubLIVE
站内改写1 分钟阅读

DocOCR-Eval:一种基于校正的无真实标注OCR工具选择框架

本文提出DocOCR-Eval,一种无需人工标注的评估框架,用于自动评估和选择OCR工具。该框架通过三阶段校正和排序策略,在缺乏真实标签的情况下近似基于标注的工具排序。实验表明,聚合多个多模态大语言模型可逐步提升与人工标注排序的一致性,为实际部署文档解析系统提供指导。

来源arXiv Machine Learning作者: Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

文档解析是视觉问答和关键信息提取等文档理解任务的基础步骤,它将非结构化的扫描图像转换为结构化表示,提取文本、视觉和布局信息。尽管已有大量光学字符识别(OCR)引擎和多模态大语言模型(MLLM)被开发用于此目的,但在给定文档集合中选择合适的文档解析方案仍然具有挑战性,尤其是在标签稀缺的情况下。

在这项工作中,研究者对多种OCR引擎和先进MLLM在多个跨领域、跨语言的扫描文档基准上进行了系统性的文本识别性能评估。这些基准涵盖了不同的文档类型和语言,旨在全面衡量各种工具的真实能力。鉴于许多OCR引擎的上下文推理能力有限且手动标注成本高昂,他们提出了DocOCR-Eval——一种无需标注的自动评估框架。

DocOCR-Eval的核心是一个三阶段校正与排序策略。首先,框架使用多个MLLM对OCR输出进行初步校正;然后,基于校正后的结果进行一致性评估;最后,通过排序算法聚合多个模型的输出,以近似基于人工标注的排序结果。这种方法无需真实标签,仅依赖模型间的相互验证。

实验中,研究者系统性地比较了多种OCR引擎和MLLM的性能。结果表明,聚合多个MLLM的结果能够逐步提升与人工标注排序的一致性,而且这种提升随着模型数量的增加而更加明显。此外,在现实的标签受限环境中,该框架也能实现可靠的OCR工具选择,为不同真实文档集合中的文档解析系统部署提供了实用指导。

该工作为解决缺乏人工标注时的OCR工具评估和选择问题提供了新思路,有望大幅降低文档处理系统的部署成本,并推动更智能的文档理解系统的发展。论文由Zihan Xu等六位作者完成,于2026年5月5日提交至arXiv,属于进行中的工作。