TrustLDM:语言扩散模型可信度基准测试
一项名为TrustLDM的新基准测试,全面评估语言扩散模型在安全性、隐私和公平性方面的可信度。研究发现,虽然模型在仅用户提示下表现良好,但附加上下文中的恶意内容会显著降低其对齐行为。此外,较长的上下文不一定产生更强的影响,解码顺序和生成长度也会影响评估结果。研究还提出了自动评估框架TrustLDM-Auto,系统性地识别脆弱配置。
语言扩散模型(LDMs)凭借其灵活的非自回归解码策略和快速推理能力,正在逐步挑战自回归模型在自然语言处理领域的主导地位。然而,这种可以任意顺序生成词元的解码方式,在带来效率优势的同时,也引入了新的可信度风险。为了系统性地评估这些风险,北京大学机器学习实验室的 Yichuan Mo 等七位研究者提出了 TrustLDM——首个专门针对语言扩散模型的可信度综合基准测试。
TrustLDM 从安全性(safety)、隐私性(privacy)和公平性(fairness)三个核心维度出发,评估了多种主流 LDM 架构在不同静态后上下文(static post context)类别下的表现。这些上下文经过精心设计,模拟了实际应用中可能遇到的恶意或有害输入。实验结果表明,当仅使用用户提示(user prompt)时,LDMs 通常能够保持较高的可信度水平;然而,一旦将恶意的后上下文附加到掩码响应(masked response)上,模型的对齐行为(alignment behavior)就会出现显著退化。更值得关注的是,研究进一步发现,较长的上下文并不必然导致更强的负面效应,解词的顺序(decoding order)和生成序列的长度(generation length)同样会对最终的可信度评估结果产生重要影响。
基于这些观察,研究团队进一步开发了 TrustLDM-Auto,一种利用 LDM 解码灵活性的自动化评估框架。该框架能够系统地扫描不同模型配置,自动识别出脆弱点,从而在全部评估模型和所有评估维度上揭示出普遍存在的可信度薄弱环节。TrustLDM 的提出不仅为 LDM 的可信度研究提供了标准化的评估工具,也为后续构建更安全、更可靠的扩散语言模型奠定了重要基础。相关代码已在 GitHub(https://github.com/PKU-ML/TrustLDM)上开源,供学术界和工业界使用与改进。