TrustLDM:語言擴散模型可信度基準測試
一項名為TrustLDM的新基準測試,全面評估語言擴散模型在安全性、隱私和公平性方面的可信度。研究發現,雖然模型在僅使用者提示下表現良好,但附加上下文中的惡意內容會顯著降低其對齊行為。此外,較長的上下文不一定產生更強的影響,解碼順序和生成長度也會影響評估結果。研究還提出了自動評估框架TrustLDM-Auto,系統性地識別脆弱配置。
語言擴散模型(LDMs)憑藉其靈活的非自迴歸解碼策略和快速推理能力,正在逐步挑戰自迴歸模型在自然語言處理領域的主導地位。然而,這種可以任意順序生成詞元的解碼方式,在帶來效率優勢的同時,也引入了新的可信度風險。為了系統性地評估這些風險,北京大學機器學習實驗室的 Yichuan Mo 等七位研究者提出了 TrustLDM——首個專門針對語言擴散模型的可信度綜合基準測試。
TrustLDM 從安全性(safety)、隱私性(privacy)和公平性(fairness)三個核心維度出發,評估了多種主流 LDM 架構在不同靜態後上下文(static post context)類別下的表現。這些上下文經過精心設計,模擬了實際應用中可能遇到的惡意或有害輸入。實驗結果表明,當僅使用使用者提示(user prompt)時,LDMs 通常能夠保持較高的可信度水平;然而,一旦將惡意的後上下文附加到掩碼響應(masked response)上,模型的對齊行為(alignment behavior)就會出現顯著退化。更值得關注的是,研究進一步發現,較長的上下文並不必然導致更強的負面效應,解詞的順序(decoding order)和生成序列的長度(generation length)同樣會對最終的可信度評估結果產生重要影響。
基於這些觀察,研究團隊進一步開發了 TrustLDM-Auto,一種利用 LDM 解碼靈活性的自動化評估框架。該框架能夠系統地掃描不同模型配置,自動識別出脆弱點,從而在全部評估模型和所有評估維度上揭示出普遍存在的可信度薄弱環節。TrustLDM 的提出不僅為 LDM 的可信度研究提供了標準化的評估工具,也為後續構建更安全、更可靠的擴散語言模型奠定了重要基礎。相關程式碼已在 GitHub(https://github.com/PKU-ML/TrustLDM)上開源,供學術界和工業界使用與改進。