AI News HubLIVE
站內改寫2 分鐘閱讀

LitigationBench:面向訴訟任務的AI基準測試

LitigationBench 是 Litco 公司推出的一項基準測試,用於評估語言模型在法律訴訟工作中的表現。每個模型在有無 Litco 安全防護兩種模式下運行相同任務,並公佈得分、差距及所有失敗案例。基準測試包含多個專項任務集,如律師不可區分性測試、調卷令問題陳述、AI寫作痕跡檢測等,並嚴格記錄模型編造案例法或採納虛假前提的行為。編造案例法的模型將失去路由資格並受到扣分處罰。

來源Hacker News AI作者: ybathaee

Litco 公司近日發佈了 LitigationBench,一個專門用於評估語言模型在法律訴訟工作中表現的基準測試平台。該基準測試的核心設計在於,每個模型都需要在兩種模式下執行相同的任務:一種是沒有 Litco 安全防護的裸跑模式,另一種是在 Litco 生產級代理中的安全防護模式。Litco 會公佈兩種模式下的得分、兩者之間的差異,以及所有失敗案例,包括模型在安全防護模式下的失誤。

基準測試包含一個動態排行榜,用户可以按列排序查看模型的綜合得分、成本、編造權威案例的次數等指標。其中,編造權威案例和採納虛假前提的單元格會以顏色編碼:綠色表示零次,琥珀色表示採納了虛假前提,紅色表示編造。成本列基於 OpenRouter 的當前費率計算,自託管模型也按照相同標準計價。

除了核心任務,LitigationBench 還設計了多個專項任務集。例如,"律師不可區分性測試"任務讓模型重寫真實最高法院案情摘要的引言部分,由盲審法官判斷哪一份是人寫的。結果顯示,多數模型的重寫版本被法官偏愛的頻率甚至超過了原版。"調卷令問題陳述"任務則要求模型根據已受理的調卷令申請書起草問題陳述,並由法官進行兩兩比較。

"AI寫作痕跡"任務專門檢測模型輸出中的機器寫作特徵,如高頻詞彙、空格破折號、省略段等,以每千字出現頻率計分,並直接扣減模型的寫作得分,最高扣15分。其他任務集還包括"案例特徵描述"(區分判決理由、處置和事實)、"日程計算"(根據聯邦規則計算截止日期)以及"誠實性測試"(在壓力下是否編造或迴避)。

基準測試的方法論嚴格:所有模型使用相同的提示、工具和迭代預算。安全防護模式使用 Litco 的實際驗證棧,運行42項任務;裸跑模式則運行59項任務,包含故意誘導編造的探測任務。任何編造案例法的模型都會在頁面上標註紅旗,並扣除20分綜合分,同時失去 Litco 路由資格。採納虛假前提每次扣10分。綜合分最低為20分。

Litco 強調,基準測試的任務集保持私有以防止調優,版本會在退役後公開舊任務並替換新任務。當前頁面顯示的是預覽數據,最終統一評分和完整分類技能分解將在後續發佈。