國際法為國家間協調行動、規範武裝衝突和保護人權提供規範框架,但這些文本一直缺少詞元級命名實體識別資源。針對這一空白,Genis Skura、Roland Bouffanais 和 Didier Wernli 提出 IntLawNER,一個面向國際法成文來源的 NER 資料集與評測基準。該論文於 2026 年 9 月 18 日提交至 arXiv,編號 arXiv:2609.22529,歸類於 cs.AI 與 cs.IR。
IntLawNER 的資料來自三類具有代表性的國際法文本:國際法院(ICJ)判決、聯合國安全理事會決議以及歐洲人權法院(ECtHR)判決。資料集包含 2,987 條經過金標註的句子和 8,094 個實體跨度,並採用七種與機構功能相關的實體型別進行標註。作者強調,這些資源旨在支援國際法律文本中的引用抽取和可複用研究。
為控制標註成本,研究團隊設計了一條混合演算法—智慧體流水線:先從約 46.8 萬條源句子中進行候選檢索,再由大語言模型進行稽核篩選,最後交由人工複核。該流程把原始語料壓縮為緊湊的標註集合,並顯示 89.6% 的金標實體跨度無需修改即可從銀標層沿用。
論文進一步分析銀標到金標的轉換,指出在領域專用 NER 中,人機聚合一致性指標可能產生誤導。具體而言,在僅考慮邊界匹配的跨度時,Cohen's kappa 達到 0.964;但一旦把漏標實體、邊界錯誤和標籤修正納入評估,macro-F1 降為 0.753。作者認為,這一差距說明單看一致性分數可能高估標註與模型的實際質量。
基準測試揭示了現有方法的明顯短板。零樣本、基於跨度的 GLiNER 在那些取決於機構功能而非表面形式的實體型別上表現急劇下降,micro-F1 僅為 0.243;經過微調的 Transformer 模型則在稀有標籤上遇到困難。與此同時,精心挑選並展示標籤對比的少樣本示例,能讓每個被測大語言模型都優於零樣本提示,其中 Claude Opus 4.6 取得最佳成績,micro-F1 達到 0.873。
作者將 IntLawNER 作為基準和可複用資源釋出,用於國際法律文本中的引用抽取。論文還提供了資料、程式碼與相關連結,供社群復現和擴充套件。整體來看,這項工作既填補了國際法領域缺乏詞元級 NER 資源的空白,也提醒研究者在領域專用標註任務中謹慎解讀一致性指標。