AI News HubLIVE
站内改写1 分钟阅读

CR4T:基于重写的青少年大语言模型安全护栏

一种名为CR4T的新框架通过将不安全的或拒绝导向的大语言模型输出重写为适合年龄的指导性回应,为青少年提供更人性化的安全防护替代方案。

来源arXiv Computational Linguistics作者: Heajun An, Qi Zhang, Vedanth Achanta, Jin-Hee Cho

随着大语言模型(LLM)在青少年数字环境中的普及,它们越来越多地介入信息查询、建议提供以及情感敏感互动。然而,现有的安全机制大多基于成人中心规范,通过拒绝式抑制来确保安全。这种方式虽然可能减少直接的政策违规,但也常常导致对话陷入死胡同,限制了建设性指导,并且未能解决青少年与AI互动中固有的发展脆弱性。

研究人员认为,青少年LLM安全不应仅仅被视为过滤问题,而应是一个社会技术性的、与发展阶段相适应的转变问题。为此,他们提出了CR4T(Critique-and-Revise-for-Teenagers)框架,这是一种与模型无关的保障机制,能够有选择地将不安全或拒绝式的输出重写为适合年龄的、具有指导性的回应,同时保留良性意图。CR4T结合了轻量级风险检测和领域条件重写,以消除风险放大内容、减少不必要的对话中断,并引入适合发展阶段的指导。

实验结果表明,有针对性的重写显著降低了不安全及拒绝性输出的发生率,同时避免了对于可接受交互的不必要干预。这些发现表明,对于面向青少年的LLM系统,选择性响应重构提供了一种比以拒绝为中心的安全护栏更以人为本的替代方案,有望在确保安全的同时维护对话的流畅性和建设性。