AI News HubLIVE
站内改写1 分钟阅读

伤害并非通用:社区特定毒性检测刻不容缓

最新研究表明,针对文本到图像生成的主流毒性检测器采用“一刀切”方法,无法有效保护边缘化社区。约35%被标记为安全的生成图像,对残障社区而言被认为有害。本文主张社区特定毒性检测(CTD),并与残障专家合作制定了针对矮小症和盲/低视力两个社区的安全指南。实验显示,现有通用检测器在零样本设置下F1评分低于随机猜测(0.32和0.37),而基于提示的适应方法(如ICL、VQA)显著提升了性能(GPT-4o达0.50和0.78),参数高效微调也以小样本取得进步,但整体性能仍远低于通用检测的0.9,凸显挑战与持续研究的必要性。

来源arXiv Computer Vision作者: Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

arXiv 最新发表的一篇论文对文本到图像(T2I)生成模型的毒性检测提出了严峻挑战。当前主流的毒性检测器采用统一的安全准则,对所有用户一视同仁。然而,这种“一刀切”的做法在保护边缘化社区方面存在严重缺陷。研究显示,在这些检测器标记为安全的图像中,约有35%被残障社区视为有害。

该论文由 Xinnuo Xu 等九位作者撰写,题为“伤害并非通用:社区特定毒性检测刻不容缓”(Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed)。作者们主张开发社区特定毒性检测(CTD)方法,并作为示例与残障专家合作,为矮小症和盲/低视力两个社区制定了专门的安全指南。

为了验证 CTD 的可行性,研究团队构建了一个包含 2400 张 T2I 生成图像的标注数据集。实验结果令人震惊:最先进的大型视觉语言模型和现有的通用毒性检测器,在零样本设置下完全无法识别符合这些社区指南的有害内容,其 F1 分数甚至低于随机猜测(分别为 0.32 和 0.37)。相比之下,基于提示的适应方法(如上下文学习 ICL 和视觉问答 VQA)显著提升了性能,其中 GPT-4o 在两个社区上的 F1 分别达到 0.50 和 0.78。此外,参数高效微调方法使得更小的模型(参数规模 0.5B 至 7B)仅需不到 100 个示例即可取得最佳 F1 为 0.48 和 0.59 的成绩,但这些方法对指南的更新较为敏感。

尽管这些改进令人鼓舞,但 CTD 的整体性能仍远低于通用毒性检测通常达到的约 0.9 的 F1 分数。这一差距凸显了 CTD 面临的重大挑战,以及在该领域进行持续深入研究的迫切需要。论文目前正在审稿中,全文可参阅 arXiv 预印本。该工作不仅在技术上指出了现有方法的局限性,更在社会层面强调了人工智能安全应当包容多样化的社区需求,而非追求单一的普适标准。