机器何时能信任法规?机器提取的法律逻辑的生存证明书
法规越来越先由机器解析再被人阅读,但不同解析器会相互分歧。这篇 arXiv 论文面向机器提取的法规语境,提出一种被动式生存证明书:通过逐属性分歧测量、1,000 次蒙特卡洛试验和单侧 Wilson 95% 置信下界,认证 Duquenne-Guigues 蕴涵基中的逻辑。在密苏里州与印度中央法律数据上,预注册留出验证通过,但在一种全局错误模型下 93.2% 的留出章低于信息量下限,说明该证书可用但脆弱。
一篇题为《机器何时能信任法规?——机器提取法律逻辑的生存证明书》的论文于 2026 年 9 月 1 日提交至 arXiv(编号 arXiv:2609.01741v1),作者为 Surya Saka。论文共 18 页,包含 9 幅图、13 张表(正文 6 张、附录 7 张)。作者表示,代码、数据产品和预注册内容将发布在 GitHub 上,并公开了完整的审计轨迹——其中包括一项被撤回的主张。
论文提出,法律条文在被人阅读之前越来越多地先由机器解析,但不同解析器之间可能产生实质性分歧。以密苏里州法规为例,两个独立编写的抽取器在“数值阈值是否存在”这一属性上的假阴性率达到 0.43。这种噪声让人质疑:机器解析后的法律逻辑中,有哪些形式蕴涵仍然可靠?
为了回答该问题,作者构造了一种被动式生存证明书,目标是 Duquenne-Guigues 蕴涵基。其做法是:先测量每个属性的抽取器间不一致程度,再在 1,000 次蒙特卡洛试验中将这种不一致回放到蕴涵基上;只有当一个蕴涵的单侧 Wilson 95% 置信下限达到 0.95 时,才予以认证。每条被认证的蕴涵都会附带前提跨度和一个最小反例。
实验使用了 29,365 个密苏里州法规条文和 502 个印度中央法律条文。预注册的留出验证门通过:在 7 个法律主题下 10 个法规族完全匹配;如果把容差放宽到 5%,则在 11 个主题下有 16 个法规族匹配。然而,在一个被广泛使用的全局错误模型下,93.2% 的留出章节低于信息量下限。作者通过 2×2 因子设计将这一现象归因于校准率迁移,而非样本选择偏差。
论文的结论是:该生存证明书“可用但脆弱”。如果要用到不同章节,应采取按章校准或对错误更宽容的策略。这项研究横跨人工智能(cs.AI)与计算语言学(cs.CL),在 ACM 分类中属于 I.2.7(自然语言处理)和 I.2.4(知识表示与推理)。