AI News HubLIVE
站內改寫1 分鐘閱讀

利用檢索增強的大語言模型藉助外部知識修復歷史文獻

歷史文獻常因物理損壞而難以辨認,現有基於掩碼語言模型的修復方法雖能利用局部上下文,但無法恢復需要外部歷史知識的命名實體。為此,我們提出了一種新框架,利用檢索增強生成(RAG)的大語言模型,結合預訓練LLM的隱含知識與顯式檢索的外部上下文,有效推斷上下文相關的專有名詞。在韓國曆史文獻上的實驗表明,該方法在恢復普通字符和命名實體上均顯著優於基線,專家評估證實其可作為領域專業人員的實用工具。

來源arXiv Computational Linguistics作者: Gabeen Kim, Kyeongpil Kang

歷史文獻是人類知識的寶庫,但物理老化和損壞常常導致文字模糊不清,嚴重阻礙了歷史研究。現有的文檔修復方法主要基於掩碼語言模型,它們能夠有效利用局部上下文來補全缺失字符,但在處理涉及歷史背景的命名實體(如人名、地名、官職等)時表現不佳,因為這些實體需要依賴外部歷史知識才能準確恢復。針對這一痛點,研究團隊引入了檢索增強生成(RAG)技術,提出全新框架“ARI”(Augmented Restoration with Information Retrieval)。

ARI框架的核心思路是將預訓練大語言模型(LLM)的內在知識與外部知識庫進行有機結合。具體而言,當遇到疑似缺失或模糊的專有名詞時,系統會先從外部歷史資料中檢索相關文檔和記錄,然後將這些外部上下文與文檔中的局部特徵一同提供給LLM,從而實現對專有名詞的精確推斷。這種方式有效彌補了傳統掩碼模型僅依賴局部信息的侷限性。

為了驗證方法的有效性,研究團隊在韓國曆史文獻上進行了大量實驗。實驗結果表明,ARI不僅在普通字符的恢復上顯著優於現有基線方法,在命名實體的恢復上更是取得了大幅度提升。此外,通過邀請歷史學家進行專家評估,ARI被證明是一個實用且高效的輔助工具,能夠幫助專家加速對歷史記錄的分析工作。該研究成果已被計算語言學頂級會議ACL 2026 Findings接收,標誌着AI在人文領域應用的重要進展。

利用檢索增強的大語言模型藉助外部知識修復歷史文獻 | AI News Hub