AI News HubLIVE
站内改写2 分钟阅读

Harvey发布法律代理基准测试LAB

Harvey推出开源法律代理基准测试LAB,包含1200多项任务,涵盖24个法律实践领域,旨在评估和提升法律AI代理的实际工作能力。

来源Hacker News AI作者: gmays

Harvey宣布推出法律代理基准测试(Legal Agent Benchmark,简称LAB),这是一个开源的评估框架,旨在衡量和改善AI代理在法律工作中的表现。LAB由Niko Grupen、Gabe Pereyra和Julio Pereyra共同开发,于2026年5月6日发布。

每个任务包含指令、客户案件材料以及代理需生成的可审阅工作产品。这种结构模仿了大型律所中任务分配、执行和审查的实际流程。LAB的目标是提供AI代理在法律工作中部署情况的清晰图景,帮助律所评估AI投资的回报率,并明确代理在哪些任务中能完全、部分或无法替代人工。

第一版LAB包含1200多个任务,涵盖24个法律实践领域,并由超过75,000条专家编写的评分标准进行评估。Harvey选择开源LAB,以便模型提供商、代理构建者、研究人员和律所能够共同衡量长周期法律代理的进展。

值得注意的是,LAB初始发布时不设排行榜,因为数据集将随时间演变。Harvey希望与社区合作,确保结果清晰直观地反映代理性能。未来几周内,他们将与研究伙伴合作,获取LAB的基线结果并发布排行榜,同时发布提交标准化指南,以便追踪基准演进中的改进。

Harvey基于过去一年构建法律代理的经验,指出此前缺乏针对长周期法律工作的基准。现有评估如LegalBench、CUAD等主要测试短周期推理。在编程领域,代理基准如SWE-Bench已显示代理能力的阶跃提升,类似模式正扩展到其他领域。LAB旨在为律所提供类似的清晰指标,帮助他们部署AI以加速客户价值,同时识别代理薄弱环节,保持人类参与。

初始结果将在未来几周内公布,以确保评分公正透明。LAB已用于内部产品评估和研究社区探索。Harvey期待LAB能创建法律代理进展的共同基础,连接AI研究和法律社区。

LAB以客户案件为中心,将代理执行和评估流程映射到法律工作:指令如同合伙人给律师的任务;环境是客户案件文件集;输出为可审阅的法律工作产品;验证通过专家评分标准。每个任务测试代理处理开放式指令的能力,例如一个并购任务要求代理分析控制权变更条款,生成备忘记要。评分标准包含57条标准,覆盖事实、结论、引用等,且采用全通过评分,因为法律工作不允许部分正确。

LAB的1200多个任务涵盖了24个法律领域,包括交易、咨询、监管和诉讼。未来将扩展至更多领域及企业法务工作。

Harvey邀请律师、律所、法律科技公司、代理研究人员和AI实验室参与合作,共同完善基准。目标是提供透明的方法衡量法律代理性能,并加速研究社区的发展。