傷害並非通用:社區特定毒性檢測刻不容緩
最新研究表明,針對文本到圖像生成的主流毒性檢測器採用“一刀切”方法,無法有效保護邊緣化社區。約35%被標記為安全的生成圖像,對殘障社區而言被認為有害。本文主張社區特定毒性檢測(CTD),並與殘障專家合作制定了針對矮小症和盲/低視力兩個社區的安全指南。實驗顯示,現有通用檢測器在零樣本設置下F1評分低於隨機猜測(0.32和0.37),而基於提示的適應方法(如ICL、VQA)顯著提升了性能(GPT-4o達0.50和0.78),參數高效微調也以小樣本取得進步,但整體性能仍遠低於通用檢測的0.9,凸顯挑戰與持續研究的必要性。
arXiv 最新發表的一篇論文對文本到圖像(T2I)生成模型的毒性檢測提出了嚴峻挑戰。當前主流的毒性檢測器採用統一的安全準則,對所有用户一視同仁。然而,這種“一刀切”的做法在保護邊緣化社區方面存在嚴重缺陷。研究顯示,在這些檢測器標記為安全的圖像中,約有35%被殘障社區視為有害。
該論文由 Xinnuo Xu 等九位作者撰寫,題為“傷害並非通用:社區特定毒性檢測刻不容緩”(Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed)。作者們主張開發社區特定毒性檢測(CTD)方法,並作為示例與殘障專家合作,為矮小症和盲/低視力兩個社區制定了專門的安全指南。
為了驗證 CTD 的可行性,研究團隊構建了一個包含 2400 張 T2I 生成圖像的標註數據集。實驗結果令人震驚:最先進的大型視覺語言模型和現有的通用毒性檢測器,在零樣本設置下完全無法識別符合這些社區指南的有害內容,其 F1 分數甚至低於隨機猜測(分別為 0.32 和 0.37)。相比之下,基於提示的適應方法(如上下文學習 ICL 和視覺問答 VQA)顯著提升了性能,其中 GPT-4o 在兩個社區上的 F1 分別達到 0.50 和 0.78。此外,參數高效微調方法使得更小的模型(參數規模 0.5B 至 7B)僅需不到 100 個示例即可取得最佳 F1 為 0.48 和 0.59 的成績,但這些方法對指南的更新較為敏感。
儘管這些改進令人鼓舞,但 CTD 的整體性能仍遠低於通用毒性檢測通常達到的約 0.9 的 F1 分數。這一差距凸顯了 CTD 面臨的重大挑戰,以及在該領域進行持續深入研究的迫切需要。論文目前正在審稿中,全文可參閲 arXiv 預印本。該工作不僅在技術上指出了現有方法的侷限性,更在社會層面強調了人工智能安全應當包容多樣化的社區需求,而非追求單一的普適標準。