从评估到护栏:我们在ACM FAccT 2026上的贡献
Mozilla AI团队在ACM FAccT 2026会议上展示了一项关于上下文评估LLM护栏的教程,强调了评估护栏本身的重要性,并介绍了他们通过难民和庇护场景的评估结果来设计动态护栏政策的方法,以及使用工具增强护栏可靠性的实践。
今年六月,Mozilla AI团队前往蒙特利尔参加ACM公平、问责与透明会议(ACM FAccT),这是安全且负责任AI发展的顶级盛会。会议汇集了计算机科学家、社会科学家、政策制定者和律师,共同探讨的不仅是“如何构建AI系统”,更是“是否、何时以及为谁构建”。在这样的背景下,我们的教程“跨语言和智能体系统的LLM护栏上下文评估”受到了广泛关注。
评估始终是贯穿AI安全领域的一条主线。当前,行业正从庆祝通用能力转向衡量实际、领域和语言特定的性能。跨领域的计划如EvalEval联盟正在为评估本身建立科学和基础设施。尽管在评估上投入了大量资金,但基准饱和和评估数据过时的问题依然存在。不过,一个实际功能始终存在:评估塑造护栏。当评估显示模型在特定语境或语言中产生有害内容时,一个自然的回应就是针对该故障设计护栏。
护栏——过滤、标记或约束LLM输入和输出的机制——决定了用户在聊天机器人、平台和公共服务中实际看到的内容。然而,它们受到的关注远少于所监管的模型。过去,护栏通常是专有分类器,仅通过无解释的拒绝来体现。开源护栏模型和基于策略提示的护栏使得独立评估成为可能。
我们在FAccT上的观点很简单:评估护栏与评估其所保护的LLM同样重要,并且基于上下文和语言的评估结果应指导护栏超越静态的危害分类,转向动态策略。
实现从评估到护栏的路径并不简单。我们的方法是:通过社区和语言知情的评估,涉及120个难民和庇护聚焦的场景对,涵盖英语、波斯语、阿拉伯语、库尔德语(索拉尼)和普什图语。这些场景由来自Respond Crisis Translation的母语评估员根据六项基于权利的标准进行评分。我们将结果以开放式MHRE评估数据集的形式发布在Mozilla Data Collective上,并与评估员共同商定条款。随后,我们将反复出现的故障(如不安全的推荐、缺失免责声明和刻板假设)转化为具体的英语和波斯语护栏政策。
测试这些政策暴露了一个结构性缺陷:像事实性和可操作性这样的标准无法仅通过文本判断。这个非政府组织是否存在?这条法律在该司法管辖区是否现行?仅文本的护栏常常对它们无法验证的回应给予认可,出现幻觉术语,并且对相同的英语和波斯语政策给出不同的评分。因此,我们提出了一个假设:LLM驱动的护栏需要诸如搜索、检索和事实核查等工具,以实现更可靠和值得信赖的判断。这就是我们在蒙特利尔测试的智能体护栏。
实操环节的结果表明,整体方法论和上下文护栏的理念(包括语言和上下文依赖的策略及工具)与参与者产生了共鸣。35位参与者通过选择自己的场景和策略,并比较智能体和非智能体判断者对相同回应的评价,运行了我们的演示。
工具改变支持证据的频率高于最终判定:90%的判定在两种模式中一致。然而,“智能体”行为高度依赖于底层的判断LLM。Claude Sonnet 4.6在每次运行中都使用网络搜索(平均每次运行4.1次工具调用),而GPT-5 Nano很少这样做(平均每次运行0.2次工具调用)。当调用工具时,它们从两方面影响结果:验证庇护相关回应中的事实声明会提高评分,而识别出非工具判断者忽视的事实错误则将判定从“通过”降为“边缘”。
为了使这些实验切实可行,我们不需要为每次比较进行新的工程开发。Mozilla AI的开源any-guardrail提供了一个统一接口,用于选择和切换带有自定义策略的护栏,使护栏层像模型一样可配置。此外,Mozilla的新开源LLM网关Otari允许您无缝地选择和切换判断背后的LLM。
接下来,我们将继续优化设计,测试工具访问是否能使LLM驱动的护栏在人道主义、金融和社会工程用例中更加可靠和值得信赖,并使用更广泛的工具和上下文场景,包括英语-波斯语和英语-西班牙语。结果即将公布,敬请期待,希望能在下一次ACM FAccT上见到您!
LLM使用声明:Roya Pakzad使用Claude Opus 4.8对本帖进行了文字编辑。