AI News HubLIVE
サイト内リライト2 分で読了

モデルが書き、審判が測る:LLM審判の解剖

この記事では、ダイヤモンド説明におけるAIアシスタントの出力を評価するための独立したLLM審判の構築について詳述し、3つのゲート(予防、捕捉、判断)と審判の誠実さを保つ方法を強調しています。

ソースHacker News AI著者: samwen2026

本記事では、ダイヤモンドの説明においてAIアシスタントの出力を評価するための独立したLLM審判の構築について詳しく説明します。著者のSam Wen氏は、AIアシスタントが「この透明度グレードでは、肉眼では何も見えません」といった流暢だが誤解を招く記述を生成する可能性があると指摘します。この文は一見もっともに思えますが、実際には透明度グレードSI1は10倍拡大下で評価されるものであり、肉眼での見え方を直接決定するものではありません。このような問題は単純なキーワードフィルターでは対処できません。

この問題に対処するため、チームは3つのゲートからなるメカニズムを設計しました。最初のゲートは予防であり、コードによってパイプライン内でモデルが証拠から答えられない質問を生成するのを防ぎます。2番目のゲートは捕捉であり、決定論的バリデーターを使用してスクリプト内に「驚くべき」「必須」などの禁止語句が含まれていないかをチェックします。ただし、文脈依存の語句は注意深く扱います——例えば「flawless」はダイヤモンド業界では専門グレードであり、単なる褒め言葉ではないため、審判に判断を委ねます。3番目のゲートは審判であり、別のLLMがもっともらしいが根拠のない主張をチェックします。

審判の設計は非常に独特です。単純な1〜10のスコアを返すのではなく、詳細な評決を提供します。各文を分類し、この石に関する主張か一般的な知識かを区別し、証拠によって裏付けられているかをチェックします。また、帰属の誤り(例えば、ラボの評価を販売店の功績とするなど)も扱います。審判はすべての主張とその分類をリストアップし、監査可能な記録を形成します。さらに、トーンとフォーマットも測定しますが、これらは独立したチャネルであり、暖かいトーンが根拠のない主張を許容することはありません。

審判自体の誠実さを保つために、チームは複数の方法を採用しています。審判と作成者は同じルール文書を共有し、基準の一貫性を確保します。審判は決して自身の出力を評価せず、異なるモデル(当初はGPT-5.5、後にClaude Opus 4.8)を使用します。審判は開発環境でのみ使用され、本番環境にレイテンシやコストを追加しません。また、審判の誤りを訂正するためのキャリブレーションループを実装しています。例えば、「flaw」という単語のフィルターが「not a flaw」という正直な文を誤って捕捉したため、ルールを「この石に欠陥はない」という絶対的な主張のみに限定するよう修正しました。

最後に、著者は審判の導入によって終結した3つの議論を共有しています:モデルの選択(Claude Sonnet 5がHaiku 4.5を大幅に上回る——前者は平均0.8件の違反、後者は約10件)、プロンプトの長さ(長ければ良いわけではない)、品質の測定方法(審判が客観的基準を提供)。審判は品質問題を解決しただけでなく、チームが個人の好みではなくデータに基づいて意思決定できるようにしました。