AI News HubLIVE
サイト内リライト2 分で読了

LitigationBench:訴訟業務向けAIベンチマーク

LitigationBench は、Litco 社が公開した、訴訟業務における言語モデルの性能を評価するベンチマークです。各モデルは、Litco のセーフガードなしとありの2つの条件下で同じタスクを実行し、そのスコアや失敗が公開されます。特別タスクセットには、実務家識別テスト、裁量上訴問題文作成、AIらしさ検出、事例特徴付け、カレンダリング、誠実性テストが含まれます。判例を捏造したモデルはルーティング資格を失い、スコアにペナルティが課されます。

ソースHacker News AI著者: ybathaee

Litco 社は、訴訟業務における言語モデルの性能を評価するためのベンチマーク「LitigationBench」を公開しました。このベンチマークの核心は、各モデルが Litco のセーフガードなしの状態と、Litco のプロダクションエージェント内でセーフガードを有効にした状態の2つで同一のタスクを実行し、両方のスコア、その差、および全ての失敗事例を公開する点にあります。

リーダーボードでは、モデルの総合スコア、コスト、捏造された権威の数などをソートして表示できます。捏造された権威や虚偽の前提を採用したセルは色分けされ、緑はゼロ、琥珀は虚偽の前提の採用、赤は捏造を示します。コスト列は OpenRouter の現在のレートに基づいて計算され、セルフホストモデルも同じ基準で評価されます。

LitigationBench には複数の特別タスクセットが含まれています。「実務家識別テスト」では、モデルに実際の最高裁判所の準備書面を書き換えさせ、ブラインド審査員団が人間が書いたものと機械が書いたものを識別しようとします。その結果、多くのモデルの書き換えが、提出された原本よりも好まれる傾向にあることが示されました。「裁量上訴問題文作成」タスクでは、モデルが認容された裁量上訴申立書に基づいて問題文を起草し、裁判官がペアごとに比較します。

「AIらしさ検出」タスクでは、モデルの出力に含まれる機械的な書き方の特徴(頻出語、スペース入りダッシュ、省略された断片など)を1000語あたりの出現数で測定し、最大15点まで執筆スコアを減点します。その他のタスクセットには、「事例特徴付け」(判決理由、処分、事実の区別)、「カレンダリング」(連邦規則に基づく期限計算)、「誠実性テスト」(圧力下での捏造や回避の有無)があります。

手法は厳格で、全てのモデルが同一のプロンプト、ツール、反復予算を使用します。セーフガードありのモードでは Litco の検証スタックを有効にした42タスクを、セーフガードなしのモードでは捏造を誘発するプローブを含む59タスクを実行します。判例法を捏造したモデルは、ページ上に赤いフラグが表示され、総合スコアから20点が減点され、Litco のルーティング資格を失います。虚偽の前提を採用した場合は10点減点されます。総合スコアの最低値は20点です。

Litco は、タスクセットを非公開にすることで過学習を防ぎ、バージョン管理を行い、旧バージョンは退役後に公開し新しいタスクに置き換えると述べています。現在のページはプレビューデータであり、最終的な統一スコアと完全なカテゴリ別スキル分析は後日公開されます。