AI News HubLIVE
站內改寫2 分鐘閱讀

少數通道繪製全域性:揭示擴散Transformer中的大規模啟用

本研究揭示了擴散Transformer(DiT)中一種稱為“大規模啟用”的現象:少數隱藏狀態通道的響應遠大於其他通道。儘管稀疏,但這些通道在功能上至關重要,具有空間組織性,並可遷移,能夠實現無需額外訓練的語義插值和主體驅動生成。

來源arXiv Computer Vision作者: Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

擴散Transformer(DiT)及其流式變體已成為文本到影像生成領域的主流架構。然而,提示詞如何影響影像語義的內部機制仍是一個黑箱。最近一篇發表於arXiv的論文《Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers》深入剖析了這一問題,發現並系統研究了“大規模啟用”現象——即隱藏狀態中極少數通道的響應值遠高於其他通道,並指出這些少數通道實際上決定了影像生成的整體語義。

研究團隊透過一系列精心設計的實驗揭示了大規模啟用的三個關鍵特性。首先,功能關鍵性:透過將大規模啟用通道的值人為置零,生成影像的質量會急劇下降,呈現災難性崩潰;而如果隨機選擇同等數量的低響應通道進行置零,則幾乎沒有影響。這直接證明了大規模啟用通道在功能上的不可替代性。

其次,空間組織性:研究將影像流中的所有令牌限制到大規模啟用通道上,然後進行聚類分析。令人驚訝的是,聚類結果與影像中的主體目標和顯著區域高度吻合——比如在生成“一隻狗在草地上”的影像時,聚類邊界清晰地勾勒出狗的形狀。這表明,在看似離群的通道子空間中,實際上隱藏著結構化的空間編碼,它像一種“隱式語義地圖”一樣指導著影像的生成。

第三,可遷移性:研究人員將某個提示條件下的軌跡中的大規模啟用,移植到另一個不同提示的生成軌跡中。結果發現,最終生成的影像會向源提示偏移,但又顯著保留了目標提示的主體內容。例如,將“貓”的啟用遷移到“狗”的軌跡中,生成的影像可能是一隻帶有貓特徵的狗——這並非簡單的畫素混合,而是語義層面的區域性插值。基於這一特性,論文提出了兩種無需額外訓練的應用:文本條件語義傳輸和影像條件語義傳輸,從而實現了無需微調的提示插值和主題驅動生成。

綜上所述,本文將大規模啟用重新定義為一種稀疏的、由提示調節的載體子空間,它組織和控制著現代DiT模型中的語義資訊。這一發現不僅加深了我們對擴散Transformer內部工作原理的理解,也為開發更高效的訓練和推理方法、以及無需訓練的影像編輯與生成技術開闢了新的可能性。該論文由Evelyn Turri等五位作者完成,於2026年5月13日提交至arXiv,並附有專案頁面供參考。