機器何時能信任法規?機器提取的法律邏輯的生存證明書
法規越來越先由機器解析再被人閲讀,但不同解析器會相互分歧。這篇 arXiv 論文面向機器提取的法規語境,提出一種被動式生存證明書:通過逐屬性分歧測量、1,000 次蒙特卡洛試驗和單側 Wilson 95% 置信下界,認證 Duquenne-Guigues 藴涵基中的邏輯。在密蘇里州與印度中央法律數據上,預註冊留出驗證通過,但在一種全局錯誤模型下 93.2% 的留出章低於信息量下限,説明該證書可用但脆弱。
一篇題為《機器何時能信任法規?——機器提取法律邏輯的生存證明書》的論文於 2026 年 9 月 1 日提交至 arXiv(編號 arXiv:2609.01741v1),作者為 Surya Saka。論文共 18 頁,包含 9 幅圖、13 張表(正文 6 張、附錄 7 張)。作者表示,代碼、數據產品和預註冊內容將發佈在 GitHub 上,並公開了完整的審計軌跡——其中包括一項被撤回的主張。
論文提出,法律條文在被人閲讀之前越來越多地先由機器解析,但不同解析器之間可能產生實質性分歧。以密蘇里州法規為例,兩個獨立編寫的抽取器在“數值閾值是否存在”這一屬性上的假陰性率達到 0.43。這種噪聲讓人質疑:機器解析後的法律邏輯中,有哪些形式藴涵仍然可靠?
為了回答該問題,作者構造了一種被動式生存證明書,目標是 Duquenne-Guigues 藴涵基。其做法是:先測量每個屬性的抽取器間不一致程度,再在 1,000 次蒙特卡洛試驗中將這種不一致回放到藴涵基上;只有當一個藴涵的單側 Wilson 95% 置信下限達到 0.95 時,才予以認證。每條被認證的藴涵都會附帶前提跨度和一個最小反例。
實驗使用了 29,365 個密蘇里州法規條文和 502 個印度中央法律條文。預註冊的留出驗證門通過:在 7 個法律主題下 10 個法規族完全匹配;如果把容差放寬到 5%,則在 11 個主題下有 16 個法規族匹配。然而,在一個被廣泛使用的全局錯誤模型下,93.2% 的留出章節低於信息量下限。作者通過 2×2 因子設計將這一現象歸因於校準率遷移,而非樣本選擇偏差。
論文的結論是:該生存證明書“可用但脆弱”。如果要用到不同章節,應採取按章校準或對錯誤更寬容的策略。這項研究橫跨人工智能(cs.AI)與計算語言學(cs.CL),在 ACM 分類中屬於 I.2.7(自然語言處理)和 I.2.4(知識表示與推理)。