從評估到護欄:我們在ACM FAccT 2026上的貢獻
Mozilla AI團隊在ACM FAccT 2026會議上展示了一項關於上下文評估LLM護欄的教程,強調了評估護欄本身的重要性,並介紹了他們透過難民和庇護場景的評估結果來設計動態護欄政策的方法,以及使用工具增強護欄可靠性的實踐。
今年六月,Mozilla AI團隊前往蒙特利爾參加ACM公平、問責與透明會議(ACM FAccT),這是安全且負責任AI發展的頂級盛會。會議彙集了電腦科學家、社會科學家、政策制定者和律師,共同探討的不僅是“如何構建AI系統”,更是“是否、何時以及為誰構建”。在這樣的背景下,我們的教程“跨語言和智慧體系統的LLM護欄上下文評估”受到了廣泛關注。
評估始終是貫穿AI安全領域的一條主線。當前,行業正從慶祝通用能力轉向衡量實際、領域和語言特定的效能。跨領域的計劃如EvalEval聯盟正在為評估本身建立科學和基礎設施。儘管在評估上投入了大量資金,但基準飽和和評估資料過時的問題依然存在。不過,一個實際功能始終存在:評估塑造護欄。當評估顯示模型在特定語境或語言中產生有害內容時,一個自然的回應就是針對該故障設計護欄。
護欄——過濾、標記或約束LLM輸入和輸出的機制——決定了使用者在聊天機器人、平臺和公共服務中實際看到的內容。然而,它們受到的關注遠少於所監管的模型。過去,護欄通常是專有分類器,僅透過無解釋的拒絕來體現。開源護欄模型和基於策略提示的護欄使得獨立評估成為可能。
我們在FAccT上的觀點很簡單:評估護欄與評估其所保護的LLM同樣重要,並且基於上下文和語言的評估結果應指導護欄超越靜態的危害分類,轉向動態策略。
實現從評估到護欄的路徑並不簡單。我們的方法是:透過社群和語言知情的評估,涉及120個難民和庇護聚焦的場景對,涵蓋英語、波斯語、阿拉伯語、庫爾德語(索拉尼)和普什圖語。這些場景由來自Respond Crisis Translation的母語評估員根據六項基於權利的標準進行評分。我們將結果以開放式MHRE評估資料集的形式釋出在Mozilla Data Collective上,並與評估員共同商定條款。隨後,我們將反覆出現的故障(如不安全的推薦、缺失免責宣告和刻板假設)轉化為具體的英語和波斯語護欄政策。
測試這些政策暴露了一個結構性缺陷:像事實性和可操作性這樣的標準無法僅透過文本判斷。這個非政府組織是否存在?這條法律在該司法管轄區是否現行?僅文本的護欄常常對它們無法驗證的回應給予認可,出現幻覺術語,並且對相同的英語和波斯語政策給出不同的評分。因此,我們提出了一個假設:LLM驅動的護欄需要諸如搜尋、檢索和事實核查等工具,以實現更可靠和值得信賴的判斷。這就是我們在蒙特利爾測試的智慧體護欄。
實操環節的結果表明,整體方法論和上下文護欄的理念(包括語言和上下文依賴的策略及工具)與參與者產生了共鳴。35位參與者透過選擇自己的場景和策略,並比較智慧體和非智慧體判斷者對相同回應的評價,執行了我們的演示。
工具改變支援證據的頻率高於最終判定:90%的判定在兩種模式中一致。然而,“智慧體”行為高度依賴於底層的判斷LLM。Claude Sonnet 4.6在每次執行中都使用網路搜尋(平均每次執行4.1次工具呼叫),而GPT-5 Nano很少這樣做(平均每次執行0.2次工具呼叫)。當呼叫工具時,它們從兩方面影響結果:驗證庇護相關回應中的事實宣告會提高評分,而識別出非工具判斷者忽視的事實錯誤則將判定從“透過”降為“邊緣”。
為了使這些實驗切實可行,我們不需要為每次比較進行新的工程開發。Mozilla AI的開源any-guardrail提供了一個統一介面,用於選擇和切換帶有自定義策略的護欄,使護欄層像模型一樣可配置。此外,Mozilla的新開源LLM閘道器Otari允許您無縫地選擇和切換判斷背後的LLM。
接下來,我們將繼續最佳化設計,測試工具訪問是否能使LLM驅動的護欄在人道主義、金融和社會工程用例中更加可靠和值得信賴,並使用更廣泛的工具和上下文場景,包括英語-波斯語和英語-西班牙語。結果即將公佈,敬請期待,希望能在下一次ACM FAccT上見到您!
LLM使用宣告:Roya Pakzad使用Claude Opus 4.8對本帖進行了文字編輯。