AI News HubLIVE
站內改寫1 分鐘閱讀

CR4T:基於重寫的青少年大語言模型安全護欄

一種名為CR4T的新框架透過將不安全的或拒絕導向的大語言模型輸出重寫為適合年齡的指導性回應,為青少年提供更人性化的安全防護替代方案。

來源arXiv Computational Linguistics作者: Heajun An, Qi Zhang, Vedanth Achanta, Jin-Hee Cho

隨著大語言模型(LLM)在青少年數字環境中的普及,它們越來越多地介入資訊查詢、建議提供以及情感敏感互動。然而,現有的安全機制大多基於成人中心規範,透過拒絕式抑制來確保安全。這種方式雖然可能減少直接的政策違規,但也常常導致對話陷入死衚衕,限制了建設性指導,並且未能解決青少年與AI互動中固有的發展脆弱性。

研究人員認為,青少年LLM安全不應僅僅被視為過濾問題,而應是一個社會技術性的、與發展階段相適應的轉變問題。為此,他們提出了CR4T(Critique-and-Revise-for-Teenagers)框架,這是一種與模型無關的保障機制,能夠有選擇地將不安全或拒絕式的輸出重寫為適合年齡的、具有指導性的回應,同時保留良性意圖。CR4T結合了輕量級風險檢測和領域條件重寫,以消除風險放大內容、減少不必要的對話中斷,並引入適合發展階段的指導。

實驗結果表明,有針對性的重寫顯著降低了不安全及拒絕性輸出的發生率,同時避免了對於可接受互動的不必要干預。這些發現表明,對於面向青少年的LLM系統,選擇性響應重構提供了一種比以拒絕為中心的安全護欄更以人為本的替代方案,有望在確保安全的同時維護對話的流暢性和建設性。