基于检索的多标签法律注释:可扩展、数据高效且无幻觉
该研究提出了将多标签法律注释转化为检索任务的方法,使用冻结的检索模型嵌入文档和标签描述,并通过k近邻预测标签。在三个法律数据集上,该方法在准确性和数据效率上表现出色,并完全消除了生成模型产生的幻觉问题。
近日,一篇题为《基于检索的多标签法律注释:可扩展、数据高效且无幻觉》的论文在arXiv上发布,提出了一种创新的法律文档注释方法。传统上,多标签法律注释需要为长篇事实密集型文档分配多个标签,这些标签来自庞大且不断演变的分类体系,且通常监督数据有限。参数化编码器往往需要针对特定任务进行训练,当标签集变化时必须重新训练;而提示生成式大语言模型成本高昂,且随着标签空间增大性能下降。该研究将法律注释重新定义为检索问题:使用冻结的检索模型将文档和标签描述嵌入到同一向量空间,然后通过k近邻搜索预测标签。这种方法使得更新标签集只需重新嵌入和重新索引,无需基于梯度的反向传播。研究团队在三个法律数据集(ECtHR-A、ECtHR-B和包含100个标签的Eurlex)上进行了实验。结果显示,检索方法在准确性和数据效率上具有竞争力。例如,在Eurlex数据集上,使用Qwen-8B检索模型将Macro-F1从GPT-5.2零样本的40.41提升至49.12,同时计算成本估计比微调降低20-30倍。即使在只有100个训练样本的情况下,检索方法在ECtHR-A上的Micro-F1也几乎翻倍(48.29对比27.87),超过了层次化Legal-BERT。研究还量化了生成式推理的可靠性缺陷:在确定性解码下,GPT-5.2在0.12-0.9%的测试样本中产生了分类体系之外的幻觉标签。相比之下,检索方法严格遵循定义的标签集,从设计上消除了幻觉。这些结果表明,基于检索模型的注释器是高基数且快速变化的法律标签空间中一个实用且可部署的替代方案。该论文第一作者为Li Zhang,论文共10页,代码和数据链接已公开。