AI News HubLIVE
站内改写1 分钟阅读

利用检索增强的大语言模型借助外部知识修复历史文献

历史文献常因物理损坏而难以辨认,现有基于掩码语言模型的修复方法虽能利用局部上下文,但无法恢复需要外部历史知识的命名实体。为此,我们提出了一种新框架,利用检索增强生成(RAG)的大语言模型,结合预训练LLM的隐含知识与显式检索的外部上下文,有效推断上下文相关的专有名词。在韩国历史文献上的实验表明,该方法在恢复普通字符和命名实体上均显著优于基线,专家评估证实其可作为领域专业人员的实用工具。

来源arXiv Computational Linguistics作者: Gabeen Kim, Kyeongpil Kang

历史文献是人类知识的宝库,但物理老化和损坏常常导致文字模糊不清,严重阻碍了历史研究。现有的文档修复方法主要基于掩码语言模型,它们能够有效利用局部上下文来补全缺失字符,但在处理涉及历史背景的命名实体(如人名、地名、官职等)时表现不佳,因为这些实体需要依赖外部历史知识才能准确恢复。针对这一痛点,研究团队引入了检索增强生成(RAG)技术,提出全新框架“ARI”(Augmented Restoration with Information Retrieval)。

ARI框架的核心思路是将预训练大语言模型(LLM)的内在知识与外部知识库进行有机结合。具体而言,当遇到疑似缺失或模糊的专有名词时,系统会先从外部历史资料中检索相关文档和记录,然后将这些外部上下文与文档中的局部特征一同提供给LLM,从而实现对专有名词的精确推断。这种方式有效弥补了传统掩码模型仅依赖局部信息的局限性。

为了验证方法的有效性,研究团队在韩国历史文献上进行了大量实验。实验结果表明,ARI不仅在普通字符的恢复上显著优于现有基线方法,在命名实体的恢复上更是取得了大幅度提升。此外,通过邀请历史学家进行专家评估,ARI被证明是一个实用且高效的辅助工具,能够帮助专家加速对历史记录的分析工作。该研究成果已被计算语言学顶级会议ACL 2026 Findings接收,标志着AI在人文领域应用的重要进展。