AI News HubLIVE
站內改寫1 分鐘閱讀

基於一億烏克蘭法院判決自動構建法律引用圖:大規模提取、拓撲分析與本體驅動聚類

研究者從1.007億份烏克蘭法院判決中提取了5.02億條引用鏈接,構建了首個大規模法律引用圖。該圖揭示了司法引用結構能無監督地編碼法律領域邊界,並以近乎完美的準確率預測未來立法重要性。主要發現包括:度分佈遵循冪律;共引投影上的社區檢測自動恢復了民法、刑法、行政法和商法等法律領域邊界;引用特徵以AUC=0.9984預測前1000篇重要文章。該本體被用於LLM輔助法律分析的工作流記憶系統。

來源arXiv Computational Linguistics作者: Volodymyr Ovcharov

近日,一項由Volodymyr Ovcharov完成的研究成功從烏克蘭的1.007億份法院判決中自動構建了首個大規模法律引用圖,提取了超過5.02億條引用鏈接。該研究作為預印本發表於arXiv,利用完整的EDSRR登記冊(包含9950萬份全文文本,總數據量達1.1TB),通過正則表達式在普通硬件上僅用約5小時就提取了六種類型的引用鏈接。在200份判決的驗證樣本中,精確度達到1.00(95% Wilson置信區間:[0.982, 1.000])。

該引用圖揭示了三個核心發現。首先,度分佈遵循冪律(alpha = 1.57 ± 0.008),將烏克蘭法院網絡置於歐盟法院和美國最高法院之間,部分中心文章被數百萬份判決引用,形成高度連接的樞紐節點。其次,對共引投影進行Louvain社區檢測,以模塊化Q=0.44-0.55恢復了法律領域邊界(民事、刑事、行政、商業),且在不同時間段內保持穩定(NMI=0.83-0.86),自動構建了植根於司法實踐的法律本體。最後,引用特徵以AUC=0.9984預測前1000篇重要文章,遠優於基於簡單計數頻率的基線(P@1000=0.655),展示了引用網絡在預測立法重要性方面的強大能力。

時間動態分析進一步發現了立法體制變化的相變現象。2022年俄羅斯入侵烏克蘭導致引用熵從11.02激增至13.49,同時湧現出與戰時立法相關的新節點,反映了法律制度對重大事件的適應性。研究者將這一引用推導出的本體作為LLM輔助法律分析工作流記憶系統的領域層,連接到本體控制的範式中,實現了對法律知識的有效組織和推理。提取流程、分析代碼和聚合統計數據已作為開放數據發佈,供其他研究者使用。該研究不僅展示了大規模法律文本分析在自動構建法律本體方面的巨大潛力,也為預測立法發展提供了新工具。