AI News HubLIVE
站内改写2 分钟阅读

属性条件多模态槽分解实现可控时尚检索

本文提出 MM-slotgate,将 Fashion-CLIP 的文本和图像嵌入分解为类别、颜色、图案和人群四个命名属性槽,每个槽带可学习的文本-图像门控。在 H&M 数据集上,macro ConstraintSatisfied@10 达 0.7566,优于等权重融合和纯文本检索;颜色属性提升尤其显著,且门控可解释、支持定向干预。

来源arXiv Computer Vision作者: Najmeh Forouzandehmehr, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

时尚检索往往需要同时满足类别、颜色、图案和人群等多个约束。传统模型将文本和图像编码成一个整体嵌入向量,虽然能够完成粗粒度匹配,却难以在检索时对某个具体属性进行干预或调试。另一类基于语义 ID 的方法虽然提供了离散的物品编码,但这些编码的优化目标通常是物品级别或残差地址,没有显式构造出带名称、可独立控制的属性槽。

针对这一空白,Najmeh Forouzandehmehr 等人提出了 MM-slotgate 多模态槽编码器。该方法以 Fashion-CLIP 为基础,将文本和图像的嵌入分解为四个命名槽:类别、颜色、图案和人群。每个槽都配有独立的文本-图像门控,从而让颜色、图案这类偏视觉的属性更多依赖图像证据,而类别、人群这类偏分类学的属性保持文本驱动。这样的设计让模型在训练时无需额外的模态标注,也能自动学会如何分配不同模态的权重。

在 H&M 数据集上,MM-slotgate 使用槽相似度与槽 logit 相结合的检索分数,取得了 0.7566 的 macro ConstraintSatisfied@10,超过了等权重多模态融合的 0.7142 和 fCLIP 纯文本检索的 0.4755。其中提升最明显的是颜色属性,从 0.321 升至 0.889,绝对提升达 0.568。这一结果与学习到的颜色门控一致:颜色门控将 57.4% 的权重分配给了图像证据。更关键的是,这些门控在没有模态监督的情况下仍然可解释:颜色偏向图像,类别偏向文本,图案和人群则介于两者之间。

在可控性方面,线性探针实验显示,除标签相关基线外没有检测到额外泄漏,说明槽编码没有混入多余信息。量化后的槽码还支持定向干预,例如对颜色槽进行针对性调整可以带来 15.3 倍的检索提升。论文于 2026 年 8 月 12 日提交至 arXiv,编号 2608.12570,分类为 cs.CV 与 cs.IR。整体结果表明,可控时尚检索更适合采用类型化、属性条件的多模态槽,而不是单一全局嵌入或不可解释的物品级语义 ID。此外,门控权重本身还可作为模态可靠性的诊断工具,帮助研究人员发现训练数据中文本与图像信息是否失衡,并为后续将槽表示扩展到其他属性、更大规模数据集或生成式模型提供了基础。