AI News HubLIVE
サイト内リライト1 分で読了

検索拡張型大規模言語モデルによる外部知識を活用した歴史文書復元

歴史文書は物理的な劣化により判読不能になることが多い。既存のマスク言語モデルに基づく復元手法は局所的な文脈を利用するが、外部の歴史知識を必要とする固有表現の復元には困難があった。本研究では、検索拡張生成(RAG)を備えた大規模言語モデルを用いた新しいフレームワークを提案する。事前学習済みLLMの暗黙的知識と明示的に検索された外部文脈を組み合わせることで、文脈依存の固有名詞の推測を効果的に軽減する。韓国歴史文書の広範な実験により、本手法はベースラインを大幅に上回り、一般文字と固有表現の両方の復元で顕著な改善を示した。専門家評価を含む包括的な評価により、ARIが分野専門家の実用的なツールとして機能し、歴史記録の分析を加速することが確認された。

ソースarXiv Computational Linguistics著者: Gabeen Kim, Kyeongpil Kang

歴史文書は貴重な知識の宝庫であるが、物理的な劣化や損傷により判読不能になることが多い。既存のマスク言語モデルを用いた復元手法は局所的な文脈を効果的に利用できるが、外部の歴史的知識を必要とする固有名詞(人名、地名、官職名など)の復元には限界がある。この課題に対処するため、本研究では検索拡張生成(RAG)を備えた大規模言語モデルを活用した新しいフレームワーク「ARI」を提案する。

ARIは、事前学習済みの大規模言語モデルが持つ暗黙的知識と、外部歴史資料から検索・取得した明示的な文脈を融合させることで、文脈依存の固有名詞を正確に推測する。具体的には、欠損・劣化した箇所の周辺テキストから検索クエリを生成し、外部知識ベースから関連文書を取得した上で、LLMに入力として与える。これにより、従来手法では困難だった歴史的固有表現の復元が可能となる。

韓国歴史文書を用いた広範な実験では、ARIは一般文字と固有表現の両方において既存手法を大幅に上回る性能を達成した。また、専門家による評価でも、ARIが歴史家の実用的なツールとして機能し、歴史記録の分析を加速できることが確認された。本研究成果は、計算言語学会のトップ会議ACL 2026のFindingsに採択されており、AIが人文科学に貢献する新たな可能性を示している。

検索拡張型大規模言語モデルによる外部知識を活用した歴史文書復元 | AI News Hub