Khondo:孟加拉语表单文档包分割的多模态基准
Khondo是首个针对孟加拉国政府表单文档包分割的基准,涵盖双语言(孟加拉语-英语)和视觉原生页面图像,包含五种拼接方案和14个行政领域。零样本评估显示多模态大语言模型在聚类页面方面表现良好,但在恢复原始页面顺序上存在困难,页面顺序重构成为关键挑战。
在政府和行政工作流程中,将多个文档合并为一个文件(即文档包)是常见做法,但将这些文档包拆分为原始文档却十分困难,尤其对于低资源语言而言。例如,孟加拉国的政府部门经常将多个表格扫描并合并为单个PDF文件,后续处理时需要准确还原每个独立的表格,而传统方法依赖OCR或人工标注,效率低下且容易出错。为了应对这一挑战,研究人员推出了Khondo(孟加拉语中意为“分割”),这是首个针对孟加拉国政府表单文档包分割的基准数据集。
与以往基于英文和OCR文本的数据集不同,Khondo采用双语言(孟加拉语-英语)设计,并且是视觉原生的——即模型直接操作页面图像,而非依赖OCR文本。该基准涵盖了五种拼接方案,从简单的顺序拼接到完全打乱,涉及14个行政领域,包括税务、教育、卫生等多个方面。数据集提供了页面边界、领域类型和页面顺序的真实标注,为模型评估提供了可靠的基础。
研究团队对多种多模态大语言模型(MLLMs)进行了零样本评估,结果显示这些模型在将页面聚类到原始文档方面表现尚可,但在页面被打乱后恢复原始顺序时却遇到了显著困难。例如,当页面顺序随机打乱后,模型虽然能识别哪些页面属于同一文档,但无法正确排列它们的顺序。为了探索困难根源,研究人员进行了两项控制实验:调整提示指令以及改变文档包的语言。
实验结果表明,两者主要影响顺序恢复而非聚类。具体来说:(a)明确的页面顺序指令虽然必要但不足以解决问题;(b)英语文档包的顺序恢复比孟加拉语包更可靠。这说明页面排序是当前的主要挑战,而语言则是次要但持续存在的因素。这一发现揭示了视觉文档理解中的一个关键瓶颈:即使模型能够识别内容,对于文档结构的顺序推理仍然薄弱。
Khondo的建立将页面顺序重构确立为基于视觉的低资源文档理解领域中的一个关键开放问题。数据集和代码已公开在Hugging Face上,供研究社区使用和进一步探索。这项工作不仅推动了孟加拉语文档处理的技术进步,也为其他低资源语言的文档理解研究提供了可参考的基准和方法。