利用依赖图和邻近特征从历史报纸中进行轻量级人物-地点关系抽取
HIPE-2026共享任务引入了从多语言历史报纸中抽取人物-地点关系的新赛道。DS@GT HIPE团队探索了在不使用预训练语言模型的情况下,轻量级可解释系统的性能上限。该系统基于依赖解析构建文档级图,提取邻近和词性特征,使用小型scikit-learn集成或紧凑图注意力网络进行分类,参数量低于847K。在官方评估中,最佳运行达到宏召回率0.5142,效率排名第3,准确率中等。关键发现:最小字符距离单独即可捕获大部分信号,额外特征带来不一致的收益;文档分组交叉验证对于避免数据泄露至关重要。
在人工智能与自然语言处理的前沿领域,关系抽取任务一直是研究热点。近日,HIPE-2026共享任务引入了新的挑战:从多语言历史报纸中进行人物-地点关系抽取。该任务要求分类预标注的人物与地点提及之间的“at”和“isAt”关系,涉及英语、法语和德语三种语言。面对大规模处理历史档案的高昂成本,DS@GT HIPE团队(官方结果中团队2)探索了轻量级、可解释系统的性能极限,其方法完全不依赖任何预训练语言模型进行关系分类。
该团队的方法首先从依赖解析构建文档级图,然后为每个实体对提取基于邻近度和词性的特征。分类阶段使用小型scikit-learn集成模型或紧凑的图注意力网络(GAT),所有提交的运行参数量均低于847K。在官方测试集(Test A,报纸测试集)上,其最佳运行达到了宏召回率0.5142,在17个参赛团队中,效率排名第3,准确率处于中游。
研究中有两个突出发现:首先,仅使用最小字符距离就能捕获大部分分类信号,添加额外工程特征带来的提升不一致,有时甚至会降低性能,这印证了先前关于“参数距离主导关系抽取”的证据。其次,在该语料库上,文档分组的交叉验证至关重要:如果使用实体对级别的划分,分数会虚高25-37个百分点,因为实体提及跨文档重复出现,而分组交叉验证消除了这种数据泄露效应。
该研究展示了在没有大型预训练模型的情况下,通过精心设计的特征和轻量级模型,仍然可以在特定任务上取得有竞争力的结果,这为资源受限的历史档案处理提供了实用方案。相关论文已被CLEF 2026 HIPE共享任务接收,将发表在CEUR Workshop Proceedings中。该论文共有19页,包含4张图表,由Mlen-Too Wesley等人撰写,于2026年7月22日提交至arXiv预印本平台。研究团队来自DS@GT实验室,他们的工作不仅在技术上展示了轻量级系统的潜力,也为数字人文领域的文本挖掘提供了新的思路。未来,团队计划探索如何进一步优化特征选择,以及将方法扩展到更多语言和关系类型。