AI News HubLIVE
サイト内リライト3 分で読了

マルチターンLLMシステムのためのステートフルガードレール:会話リスク蓄積フレームワーク

既存の大規模言語モデル(LLM)の安全ガードレールは各プロンプトと応答のペアを個別に評価するため、会話中に無害なターンが蓄積して害を生じる失敗を見逃します。本論文では、会話リスク蓄積(CRA)の概念と、セマンティックドリフト、感度重み付き情報蓄積グラフ、コンプライアンス勾配を追跡するセッション層フレームワークを提案します。CRA-Benchベンチマークと評価プロトコルも公開します。

ソースarXiv Computational Linguistics著者: Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

既存の大規模言語モデル(LLM)向け安全ガードレールは、通常、各プロンプトと応答のペアを個別に評価します。この方法では、複数の無害なターンが組み合わさって害を生じる、マルチターン会話に特有の失敗を見落とします。研究者はこの現象を「会話リスク蓄積(Conversational Risk Accumulation, CRA)」と名付け、意図の徐々のドリフト、禁止命令の断片的な組み立て、繰り返される開示による感度の蓄積として特徴づけています。意図ドリフトは、ユーザーが一連の徐々に変化する質問を通じてモデルの安全制限を回避することを指します。断片的な禁止命令の組み立ては、禁止された指示を複数のターンに分散させ、モデルに気づかれずに実行させるものです。感度蓄積は、モデルが複数のやり取りで徐々に機密情報を開示することから生じます。これらのリスクは単一ターンの評価ではまったく見えないため、会話レベルの動的脅威を捉える新しいフレームワークが必要です。

この課題に対処するため、本論文ではセッション層のCRAフレームワークを提案します。このフレームワークは3つの軌道信号を追跡します:セッションアンカーからのセマンティックドリフト、抽出されたエンティティに対する感度重み付き情報蓄積グラフ、以及びモデルのコンプライアンス意思の増加を捉えるコンプライアンス勾配信号です。セマンティックドリフト信号は、現在の会話と初期アンカーとの間の意味的距離の変化を検出し、閾値を超えたときにアラートを発します。情報蓄積グラフは、会話から抽出されたエンティティとその感度重みを構築し、機密情報の累積量を追跡します。コンプライアンス勾配は、連続するターンでモデルが安全ルールに違反する傾向を分析し、差し迫った違反を予測します。スコアリングのために、研究者は教師なし凸融合による帰属とアブレーション、以及びコンパクトな学習ベースの軌道モデルCRA-Net DAを提供します。CRA-Net DAは家族敵対的目的で学習され、長さとトピックカバレッジの交絡を低減します。軽量なアーキテクチャを採用し、高い検出精度を維持しながら計算オーバーヘッドを削減します。

ベンチマークとして、研究者はCRA-Bench v0.1(3つの脅威ファミリーにわたる1,200の8ターンセッション、トピック一致の良性双子セッション付き)、CRA-Bench v0.2(テンプレートアーティファクト低減のためのLLMパラフレーズ版)、および拡張5ファミリーセット(2,000セッション追加、ペルソナプライミングとコンテキストスタッフィングを含む)を公開します。3つの脅威ファミリーは、意図ドリフト(ユーザーが徐々に話題を変える)、断片的指示(禁止操作を複数ステップに分割)、機密情報蓄積(個人情報を徐々に尋ねる)を含みます。良性双子セッションは、偽陽性率の較正に使用されます。評価プロトコルは、セッションレベルの分割、混合セット閾値調整、軌道AUROC、検出までのターン数、校正された偽陽性指標、ブートストラップ信頼区間、1ファミリー除外診断ストレステスト、および合成から人間への転送チェックを含む軌道ネイティブなものです。軌道AUROCは、会話軌道全体でのモデルの識別能力を評価し、検出までのターン数はリスク露出の時間窓を測定します。

本研究の主張は、CRA-Benchおよび人間転送サブセットにおける分布内セッションスコアリングに焦点を当てています。実験結果は、CRAフレームワークがマルチターン会話における累積リスクを効果的に検出し、低い偽陽性率を維持しながら高い検出率を達成することを示しています。CRA-Net DAは軌道AUROC指標でベースライン手法を大幅に上回り、異なる脅威ファミリーに対してロバストです。この研究は、マルチターンLLMシステムの安全性評価に新たな視点とツールを提供し、単一ターン評価では検出が難しい累積的リスクの検出に貢献します。安全な対話AIシステムの構築に重要な価値を持ちます。