LitigationBench:面向诉讼任务的AI基准测试
LitigationBench 是 Litco 公司推出的一项基准测试,用于评估语言模型在法律诉讼工作中的表现。每个模型在有无 Litco 安全防护两种模式下运行相同任务,并公布得分、差距及所有失败案例。基准测试包含多个专项任务集,如律师不可区分性测试、调卷令问题陈述、AI写作痕迹检测等,并严格记录模型编造案例法或采纳虚假前提的行为。编造案例法的模型将失去路由资格并受到扣分处罚。
Litco 公司近日发布了 LitigationBench,一个专门用于评估语言模型在法律诉讼工作中表现的基准测试平台。该基准测试的核心设计在于,每个模型都需要在两种模式下执行相同的任务:一种是没有 Litco 安全防护的裸跑模式,另一种是在 Litco 生产级代理中的安全防护模式。Litco 会公布两种模式下的得分、两者之间的差异,以及所有失败案例,包括模型在安全防护模式下的失误。
基准测试包含一个动态排行榜,用户可以按列排序查看模型的综合得分、成本、编造权威案例的次数等指标。其中,编造权威案例和采纳虚假前提的单元格会以颜色编码:绿色表示零次,琥珀色表示采纳了虚假前提,红色表示编造。成本列基于 OpenRouter 的当前费率计算,自托管模型也按照相同标准计价。
除了核心任务,LitigationBench 还设计了多个专项任务集。例如,"律师不可区分性测试"任务让模型重写真实最高法院案情摘要的引言部分,由盲审法官判断哪一份是人写的。结果显示,多数模型的重写版本被法官偏爱的频率甚至超过了原版。"调卷令问题陈述"任务则要求模型根据已受理的调卷令申请书起草问题陈述,并由法官进行两两比较。
"AI写作痕迹"任务专门检测模型输出中的机器写作特征,如高频词汇、空格破折号、省略段等,以每千字出现频率计分,并直接扣减模型的写作得分,最高扣15分。其他任务集还包括"案例特征描述"(区分判决理由、处置和事实)、"日程计算"(根据联邦规则计算截止日期)以及"诚实性测试"(在压力下是否编造或回避)。
基准测试的方法论严格:所有模型使用相同的提示、工具和迭代预算。安全防护模式使用 Litco 的实际验证栈,运行42项任务;裸跑模式则运行59项任务,包含故意诱导编造的探测任务。任何编造案例法的模型都会在页面上标注红旗,并扣除20分综合分,同时失去 Litco 路由资格。采纳虚假前提每次扣10分。综合分最低为20分。
Litco 强调,基准测试的任务集保持私有以防止调优,版本会在退役后公开旧任务并替换新任务。当前页面显示的是预览数据,最终统一评分和完整分类技能分解将在后续发布。