AI News HubLIVE
站內改寫2 分鐘閱讀

Harvey發佈法律代理基準測試LAB

Harvey推出開源法律代理基準測試LAB,包含1200多項任務,涵蓋24個法律實踐領域,旨在評估和提升法律AI代理的實際工作能力。

來源Hacker News AI作者: gmays

Harvey宣佈推出法律代理基準測試(Legal Agent Benchmark,簡稱LAB),這是一個開源的評估框架,旨在衡量和改善AI代理在法律工作中的表現。LAB由Niko Grupen、Gabe Pereyra和Julio Pereyra共同開發,於2026年5月6日發佈。

每個任務包含指令、客户案件材料以及代理需生成的可審閲工作產品。這種結構模仿了大型律所中任務分配、執行和審查的實際流程。LAB的目標是提供AI代理在法律工作中部署情況的清晰圖景,幫助律所評估AI投資的回報率,並明確代理在哪些任務中能完全、部分或無法替代人工。

第一版LAB包含1200多個任務,涵蓋24個法律實踐領域,並由超過75,000條專家編寫的評分標準進行評估。Harvey選擇開源LAB,以便模型提供商、代理構建者、研究人員和律所能夠共同衡量長週期法律代理的進展。

值得注意的是,LAB初始發佈時不設排行榜,因為數據集將隨時間演變。Harvey希望與社區合作,確保結果清晰直觀地反映代理性能。未來幾周內,他們將與研究夥伴合作,獲取LAB的基線結果併發布排行榜,同時發佈提交標準化指南,以便追蹤基準演進中的改進。

Harvey基於過去一年構建法律代理的經驗,指出此前缺乏針對長週期法律工作的基準。現有評估如LegalBench、CUAD等主要測試短週期推理。在編程領域,代理基準如SWE-Bench已顯示代理能力的階躍提升,類似模式正擴展到其他領域。LAB旨在為律所提供類似的清晰指標,幫助他們部署AI以加速客户價值,同時識別代理薄弱環節,保持人類參與。

初始結果將在未來幾周內公佈,以確保評分公正透明。LAB已用於內部產品評估和研究社區探索。Harvey期待LAB能創建法律代理進展的共同基礎,連接AI研究和法律社區。

LAB以客户案件為中心,將代理執行和評估流程映射到法律工作:指令如同合夥人給律師的任務;環境是客户案件文件集;輸出為可審閲的法律工作產品;驗證通過專家評分標準。每個任務測試代理處理開放式指令的能力,例如一個併購任務要求代理分析控制權變更條款,生成備忘記要。評分標準包含57條標準,覆蓋事實、結論、引用等,且採用全通過評分,因為法律工作不允許部分正確。

LAB的1200多個任務涵蓋了24個法律領域,包括交易、諮詢、監管和訴訟。未來將擴展至更多領域及企業法務工作。

Harvey邀請律師、律所、法律科技公司、代理研究人員和AI實驗室參與合作,共同完善基準。目標是提供透明的方法衡量法律代理性能,並加速研究社區的發展。