国际法为国家间协调行动、规范武装冲突和保护人权提供规范框架,但这些文本一直缺少词元级命名实体识别资源。针对这一空白,Genis Skura、Roland Bouffanais 和 Didier Wernli 提出 IntLawNER,一个面向国际法成文来源的 NER 数据集与评测基准。该论文于 2026 年 9 月 18 日提交至 arXiv,编号 arXiv:2609.22529,归类于 cs.AI 与 cs.IR。
IntLawNER 的数据来自三类具有代表性的国际法文本:国际法院(ICJ)判决、联合国安全理事会决议以及欧洲人权法院(ECtHR)判决。数据集包含 2,987 条经过金标注的句子和 8,094 个实体跨度,并采用七种与机构功能相关的实体类型进行标注。作者强调,这些资源旨在支持国际法律文本中的引用抽取和可复用研究。
为控制标注成本,研究团队设计了一条混合算法—智能体流水线:先从约 46.8 万条源句子中进行候选检索,再由大语言模型进行审核筛选,最后交由人工复核。该流程把原始语料压缩为紧凑的标注集合,并显示 89.6% 的金标实体跨度无需修改即可从银标层沿用。
论文进一步分析银标到金标的转换,指出在领域专用 NER 中,人机聚合一致性指标可能产生误导。具体而言,在仅考虑边界匹配的跨度时,Cohen's kappa 达到 0.964;但一旦把漏标实体、边界错误和标签修正纳入评估,macro-F1 降为 0.753。作者认为,这一差距说明单看一致性分数可能高估标注与模型的实际质量。
基准测试揭示了现有方法的明显短板。零样本、基于跨度的 GLiNER 在那些取决于机构功能而非表面形式的实体类型上表现急剧下降,micro-F1 仅为 0.243;经过微调的 Transformer 模型则在稀有标签上遇到困难。与此同时,精心挑选并展示标签对比的少样本示例,能让每个被测大语言模型都优于零样本提示,其中 Claude Opus 4.6 取得最佳成绩,micro-F1 达到 0.873。
作者将 IntLawNER 作为基准和可复用资源发布,用于国际法律文本中的引用抽取。论文还提供了数据、代码与相关链接,供社区复现和扩展。整体来看,这项工作既填补了国际法领域缺乏词元级 NER 资源的空白,也提醒研究者在领域专用标注任务中谨慎解读一致性指标。