Semalith v1.4:校准的184M安全分类器,以比Llama-Guard-3-8B少44倍的参数实现最先进的提示注入检测
Semalith v1.4是一个184M参数的DeBERTa-v3-base分类器,能够在单次前向传播中同时进行提示注入、一般危害和金融服务监管合规的三轴安全分类。在22个基准测试中,它以44倍更少的参数在提示注入检测上全面超越Llama-Guard-3-8B,并在208个良性代理提示上实现零误报率。
大型语言模型(LLM)在金融服务和代理环境中的部署正面临日益复杂的安全挑战。这些场景要求安全分类器能够同时处理三类威胁:提示注入攻击、一般性有害内容以及金融服务监管合规要求。然而,现有的开源防护栏(guardrail)没有一个能在单次推理中同时满足这三项需求。针对这一空白,Tejasvi C. Addagada等人于2026年5月6日提交了论文,介绍了Semalith v1.4——一个仅有1.84亿参数的校准安全分类器,在多项基准测试中展现了卓越性能。
Semalith v1.4基于DeBERTa-v3-base架构,其核心创新在于一个“三轴”分类头设计。该分类头包含22个类别:一个无害类别(BENIGN)、九种提示注入子类型、一个一般危害类别,以及十一个面向金融服务的监管合规标签(BFSI)。此外,它还配备了一个4类辅助超级类别头,用于辅助分类。整个模型通过联合加权损失函数进行训练,训练数据来自49个公开来源,共计76,204行样本。为了确保评估的公正性,作者对每个保留评估集进行了SHA-1去重处理,使得22个基准测试中有21个实现了零数据污染(最大污染率仅为0.22%)。
在与当前最先进的安全分类器Llama-Guard-3-8B的对比中,Semalith v1.4展现了令人瞩目的结果。在22个保留基准测试上,Semalith v1.4在所有7个提示注入评估中均获胜,并在总共18个基准测试中赢得了11个,而参数数量仅为Llama-Guard-3-8B的44分之一。更令人印象深刻的是,在208个良性代理提示上,Semalith v1.4的误报率(FPR)为0.000,而Llama-Guard-3-8B的误报率高达0.063。这意味着Semalith v1.4几乎不会错误地将无害提示标记为有害,这对于实际部署至关重要。然而,论文也诚实地指出了模型的局限性:在一般危害检测基准(如WildGuardMix、HEx-PHI、HarmBench)上,Llama-Guard-3仍然保持领先。这种互补性的差异在论文第4节中有详细分析,表明两个模型在不同的安全维度上各有优势。此外,论文第6节还公开了Semalith v1.4的六个已测量弱点,为后续改进提供了方向。
在部署建议方面,论文提供了明确的指导:如果主要任务是需要高精度的对话内容审核,推荐使用Semalith v1.3版本(在ToxicChat数据集上的F1得分达到0.624);而当应用场景要求覆盖BFSI监管标签,或者需要在良性代理提示上实现零误报率时,v1.4是更优的选择。Semalith v1.4的发布不仅填补了多轴安全分类的空白,也展示了小参数模型在特定任务上超越大模型的潜力,为安全分类器的研究和应用开辟了新的路径。