AI News HubLIVE
站內改寫1 分鐘閱讀

基於檢索的多標籤法律註釋:可擴充套件、資料高效且無幻覺

該研究提出了將多標籤法律註釋轉化為檢索任務的方法,使用凍結的檢索模型嵌入文件和標籤描述,並透過k近鄰預測標籤。在三個法律資料集上,該方法在準確性和資料效率上表現出色,並完全消除了生成模型產生的幻覺問題。

來源arXiv Computational Linguistics作者: Li Zhang, Jaromir Savelka, Kevin Ashley

近日,一篇題為《基於檢索的多標籤法律註釋:可擴充套件、資料高效且無幻覺》的論文在arXiv上釋出,提出了一種創新的法律文件註釋方法。傳統上,多標籤法律註釋需要為長篇事實密集型文件分配多個標籤,這些標籤來自龐大且不斷演變的分類體系,且通常監督資料有限。引數化編碼器往往需要針對特定任務進行訓練,當標籤集變化時必須重新訓練;而提示生成式大語言模型成本高昂,且隨著標籤空間增大效能下降。該研究將法律註釋重新定義為檢索問題:使用凍結的檢索模型將文件和標籤描述嵌入到同一向量空間,然後透過k近鄰搜尋預測標籤。這種方法使得更新標籤集只需重新嵌入和重新索引,無需基於梯度的反向傳播。研究團隊在三個法律資料集(ECtHR-A、ECtHR-B和包含100個標籤的Eurlex)上進行了實驗。結果顯示,檢索方法在準確性和資料效率上具有競爭力。例如,在Eurlex資料集上,使用Qwen-8B檢索模型將Macro-F1從GPT-5.2零樣本的40.41提升至49.12,同時計算成本估計比微調降低20-30倍。即使在只有100個訓練樣本的情況下,檢索方法在ECtHR-A上的Micro-F1也幾乎翻倍(48.29對比27.87),超過了層次化Legal-BERT。研究還量化了生成式推理的可靠性缺陷:在確定性解碼下,GPT-5.2在0.12-0.9%的測試樣本中產生了分類體系之外的幻覺標籤。相比之下,檢索方法嚴格遵循定義的標籤集,從設計上消除了幻覺。這些結果表明,基於檢索模型的註釋器是高基數且快速變化的法律標籤空間中一個實用且可部署的替代方案。該論文第一作者為Li Zhang,論文共10頁,程式碼和資料連結已公開。