AI News HubLIVE
サイト内リライト2 分で読了

少数チャンネルが全体像を描く:拡散トランスフォーマーにおける巨大活性の解明

本研究では、拡散トランスフォーマー(DiT)における「巨大活性」現象を解明。隠れ状態チャンネルの一部の応答が常に他よりはるかに大きい。疎であるにもかかわらず、これらのチャンネルは機能的に重要で、空間的に編成され、転移可能であり、追加学習なしでプロンプト補間や被写体駆動生成を可能にする。

ソースarXiv Computer Vision著者: Evelyn Turri, Davide Bucciarelli, Sara Sarto, Lorenzo Baraldi, Marcella Cornia

拡散トランスフォーマー(DiT)およびそのフローベースの変種は、テキストから画像を生成する最も強力なモデルの一つとなっている。しかし、プロンプトが画像のセマンティクスをどのように形成するかという内部メカニズムは、まだほとんど解明されていない。最近arXivに投稿された論文「Few Channels Draw The Whole Picture: Revealing Massive Activations in Diffusion Transformers」は、この問題に深く切り込み、「大規模活性化」現象を発見し、体系的に調査した。この現象とは、隠れ状態チャンネルのごく一部の応答が常に他のチャンネルよりもはるかに大きいというものである。

研究チームは、一連の綿密な実験を通じて、大規模活性化の3つの重要な特性を明らかにした。第一に、機能的極めて重要である。大規模活性化チャンネルの値を強制的にゼロにすると、生成画像の品質が急激に悪化し、ほぼ破滅的な結果となる。一方、同数の低応答チャンネルをゼロにしても影響はほとんどない。これは、これらのチャンネルが機能的に不可欠であることを示している。

第二に、それらは空間的に組織化されている。画像ストリームのトークンを大規模活性化チャンネルのみに制限し、クラスタリングを実行すると、クラスタは画像内の主要な被写体や顕著な領域と非常によく一致する。例えば、「芝生の上の犬」を生成する際、クラスタ境界は犬の形状を明確に描き出す。これは、一見外れ値のように見える部分空間の内部に、構造化された空間コードが隠されていることを示している。

第三に、大規模活性化は転移可能である。あるプロンプト条件下の軌跡から別の異なるプロンプトの生成軌跡へ大規模活性化を移植すると、最終画像はソースプロンプトに向かってシフトするが、ターゲットプロンプトの主要コンテンツも顕著に保持される。例えば、「猫」の活性化を「犬」の軌跡に移植すると、猫の特徴を持つ犬のような画像が生成される。これは単なるピクセルブレンドではなく、意味レベルの局所補間である。この特性を利用して、論文では2つの追加訓練不要の応用を提案している:テキスト条件の意味転送と画像条件の意味転送であり、プロンプト補間と被写体駆動生成を追加訓練なしで実現する。

これらの結果は、大規模活性化を活性異常ではなく、現代のDiTモデルにおいて意味情報を組織化・制御する疎なプロンプト調整キャリア部分空間として再定義する。この発見は、拡散トランスフォーマーの内部動作原理の理解を深めるだけでなく、より効率的な訓練・推論方法や、訓練不要の画像編集・生成技術の開発に新たな可能性を開く。本論文はEvelyn Turriら5名の著者により、2026年5月13日にarXivに提出され、プロジェクトページも公開されている。