CR4T: 書き換えに基づく青少年向けLLM安全ガードレール
CR4Tという新しいフレームワークは、安全でないまたは拒否指向のLLM出力を年齢に適したガイダンス応答に書き換えることで、青少年に対してより人間中心の安全対策を提供する。
大規模言語モデル(LLM)は、情報検索、アドバイス、感情的に敏感なやり取りを仲介する形で、青少年のデジタル環境にますます組み込まれている。しかし、既存の安全メカニズムは主に大人中心の規範に基づいており、拒否による抑制を通じて安全を運用している。このようなアプローチは即時のポリシー違反を減らす可能性がある一方で、会話の行き詰まりを生み、建設的なガイダンスを制限し、青少年とAIの相互作用に固有の発達上の脆弱性に対処できない。
研究者らは、青少年のLLM安全性は単なるフィルタリング問題ではなく、社会技術的かつ発達に合わせた変革問題として捉えるべきだと主張する。この視点を具体化するために、彼らはCR4T(Critique-and-Revise-for-Teenagers)を提案する。これはモデルに依存しない保護フレームワークであり、安全でないまたは拒否スタイルの出力を選択的に、年齢に適したガイダンス指向の応答に再構築し、良性の意図を保持する。CR4Tは軽量なリスク検出とドメイン条件付き書き換えを組み合わせ、リスクを増幅するコンテンツを除去し、不要な会話の停止を減らし、発達に適したガイダンスを導入する。
実験結果は、対象を絞った書き換えが、安全でないおよび拒否指向の結果を大幅に削減し、許容可能な相互作用への不必要な介入を回避することを示している。これらの発見は、選択的な応答再構築が、青少年向けLLMシステムにおいて拒否中心のガードレールに代わる、より人間中心の代替手段を提供することを示唆している。