AI News HubLIVE
站内改写2 分钟阅读

少数通道绘制全局:揭示扩散Transformer中的大规模激活

本研究揭示了扩散Transformer(DiT)中一种称为“大规模激活”的现象:少数隐藏状态通道的响应远大于其他通道。尽管稀疏,但这些通道在功能上至关重要,具有空间组织性,并可迁移,能够实现无需额外训练的语义插值和主体驱动生成。

来源arXiv Computer Vision作者: Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

扩散Transformer(DiT)及其流式变体已成为文本到图像生成领域的主流架构。然而,提示词如何影响图像语义的内部机制仍是一个黑箱。最近一篇发表于arXiv的论文《Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers》深入剖析了这一问题,发现并系统研究了“大规模激活”现象——即隐藏状态中极少数通道的响应值远高于其他通道,并指出这些少数通道实际上决定了图像生成的整体语义。

研究团队通过一系列精心设计的实验揭示了大规模激活的三个关键特性。首先,功能关键性:通过将大规模激活通道的值人为置零,生成图像的质量会急剧下降,呈现灾难性崩溃;而如果随机选择同等数量的低响应通道进行置零,则几乎没有影响。这直接证明了大规模激活通道在功能上的不可替代性。

其次,空间组织性:研究将图像流中的所有令牌限制到大规模激活通道上,然后进行聚类分析。令人惊讶的是,聚类结果与图像中的主体目标和显著区域高度吻合——比如在生成“一只狗在草地上”的图像时,聚类边界清晰地勾勒出狗的形状。这表明,在看似离群的通道子空间中,实际上隐藏着结构化的空间编码,它像一种“隐式语义地图”一样指导着图像的生成。

第三,可迁移性:研究人员将某个提示条件下的轨迹中的大规模激活,移植到另一个不同提示的生成轨迹中。结果发现,最终生成的图像会向源提示偏移,但又显著保留了目标提示的主体内容。例如,将“猫”的激活迁移到“狗”的轨迹中,生成的图像可能是一只带有猫特征的狗——这并非简单的像素混合,而是语义层面的局部插值。基于这一特性,论文提出了两种无需额外训练的应用:文本条件语义传输和图像条件语义传输,从而实现了无需微调的提示插值和主题驱动生成。

综上所述,本文将大规模激活重新定义为一种稀疏的、由提示调节的载体子空间,它组织和控制着现代DiT模型中的语义信息。这一发现不仅加深了我们对扩散Transformer内部工作原理的理解,也为开发更高效的训练和推理方法、以及无需训练的图像编辑与生成技术开辟了新的可能性。该论文由Evelyn Turri等五位作者完成,于2026年5月13日提交至arXiv,并附有项目页面供参考。