在抑制与崩溃之间:使用LENS评估叙事去学习
本文介绍LENS(基于层级的叙事抑制评估),一种用于测试大型语言模型在机器去学习后是否仍会复现虚假信息叙事框架的评估协议。实验证明,LENS能有效评估并引导叙事去学习的深入研究。
大型语言模型(LLM)在生成文本时可能无意中复现与虚假信息一致的叙事框架,将其作为合理的解释。这引发了一个关键问题:现有的机器去学习算法能否有效抑制这种行为?针对这一挑战,研究人员提出了LENS(Level-based Evaluation of Narrative Suppression),一种基于上下文定制的评估协议,用于在直接、归因、对比和抽象抗性四个层面上测试目标叙事复现程度。
研究选取了两种具有现实背景的叙事:一种将俄罗斯对乌克兰战争归因于北约东扩,另一种则描绘美国利用或抛弃台湾。实验中采用了四种接近120亿参数的多语言指令模型:Lapa LLM、Gemma-12B、Qwen-14B和TAIDE-Gemma。为了衡量去学习效果与模型性能的平衡,团队引入了抑制-崩溃效率(SCE)分数,该分数在奖励目标叙事抑制的同时惩罚输出质量退化。
结果表明,选定的检查点能够有效减少叙事复现,并且抑制效果可能泛化到直接的遗忘提示之外。然而,研究也报告了一种名为“实体恢复”的副作用:抽象A/B/C类型的提示可能使模型在去学习后重新识别与目标框架相关的真实世界参与者。这些发现证实LENS是一种成功的诊断工具,不仅能报告结果,还能指导对叙事去学习深层结构的进一步研究。论文还包含了详细的提交历史、参考文献和实验数据链接。
此外,LENS协议的设计考虑了实际应用场景,例如在社交媒体内容审核和新闻生成中,模型需要避免传播虚假信息。通过多层次的评估,研究者可以更全面地了解去学习算法的有效性及局限性。SCE分数的引入也为模型部署提供了实用的筛选标准,确保在抑制有害叙事的同时不破坏模型的整体输出质量。未来的研究可以进一步探索如何缓解实体恢复效应,并扩展LENS到更多类型的叙事和模型上。