Semalith v1.4:校準的184M安全分類器,以比Llama-Guard-3-8B少44倍的參數實現最先進的提示注入檢測
Semalith v1.4是一個184M參數的DeBERTa-v3-base分類器,能夠在單次前向傳播中同時進行提示注入、一般危害和金融服務監管合規的三軸安全分類。在22個基準測試中,它以44倍更少的參數在提示注入檢測上全面超越Llama-Guard-3-8B,並在208個良性代理提示上實現零誤報率。
大型語言模型(LLM)在金融服務和代理環境中的部署正面臨日益複雜的安全挑戰。這些場景要求安全分類器能夠同時處理三類威脅:提示注入攻擊、一般性有害內容以及金融服務監管合規要求。然而,現有的開源防護欄(guardrail)沒有一個能在單次推理中同時滿足這三項需求。針對這一空白,Tejasvi C. Addagada等人於2026年5月6日提交了論文,介紹了Semalith v1.4——一個僅有1.84億參數的校準安全分類器,在多項基準測試中展現了卓越性能。
Semalith v1.4基於DeBERTa-v3-base架構,其核心創新在於一個“三軸”分類頭設計。該分類頭包含22個類別:一個無害類別(BENIGN)、九種提示注入子類型、一個一般危害類別,以及十一個面向金融服務的監管合規標籤(BFSI)。此外,它還配備了一個4類輔助超級類別頭,用於輔助分類。整個模型通過聯合加權損失函數進行訓練,訓練數據來自49個公開來源,共計76,204行樣本。為了確保評估的公正性,作者對每個保留評估集進行了SHA-1去重處理,使得22個基準測試中有21個實現了零數據污染(最大污染率僅為0.22%)。
在與當前最先進的安全分類器Llama-Guard-3-8B的對比中,Semalith v1.4展現了令人矚目的結果。在22個保留基準測試上,Semalith v1.4在所有7個提示注入評估中均獲勝,並在總共18個基準測試中贏得了11個,而參數數量僅為Llama-Guard-3-8B的44分之一。更令人印象深刻的是,在208個良性代理提示上,Semalith v1.4的誤報率(FPR)為0.000,而Llama-Guard-3-8B的誤報率高達0.063。這意味着Semalith v1.4幾乎不會錯誤地將無害提示標記為有害,這對於實際部署至關重要。然而,論文也誠實地指出了模型的侷限性:在一般危害檢測基準(如WildGuardMix、HEx-PHI、HarmBench)上,Llama-Guard-3仍然保持領先。這種互補性的差異在論文第4節中有詳細分析,表明兩個模型在不同的安全維度上各有優勢。此外,論文第6節還公開了Semalith v1.4的六個已測量弱點,為後續改進提供了方向。
在部署建議方面,論文提供了明確的指導:如果主要任務是需要高精度的對話內容審核,推薦使用Semalith v1.3版本(在ToxicChat數據集上的F1得分達到0.624);而當應用場景要求覆蓋BFSI監管標籤,或者需要在良性代理提示上實現零誤報率時,v1.4是更優的選擇。Semalith v1.4的發佈不僅填補了多軸安全分類的空白,也展示了小參數模型在特定任務上超越大模型的潛力,為安全分類器的研究和應用開闢了新的路徑。