AI News HubLIVE
サイト内リライト4 分で読了

AlibabaのQwen-Image-2.0、圧縮率を2倍にし、生成ステップを40から4に削減

Alibabaの技術レポートによると、Qwen-Image-2.0は画像を競合の2倍圧縮し、再設計されたTransformerでトレーニングを安定化し、短いユーザー入力を詳細なプロンプトに自動拡張する専用モジュールを搭載。蒸留版は40ステップではなく4ステップで動作。LMArenaで現在9位。

ソースThe Decoder著者: Jonathan Kemper

Alibabaは、最新の画像生成モデルQwen-Image-2.0に関する技術レポートを公開しました。このモデルは、トレーニングと推論の両方で効率を大幅に向上させており、主な改善点として、より積極的な圧縮を行うVAE、再設計された画像Transformer、およびユーザーの短いプロンプトを詳細な説明に拡張する専用モジュールが含まれています。

画像モデルは通常、生のピクセルを直接処理するのではなく、VAEを使用して画像をより小さな潜在表現に圧縮し、そこから完全な画像を再構築します。圧縮率が高いほど、画像モデル自体のトレーニングは高速かつ低コストになります。現在、ほとんどのオープンソースモデルは8倍の空間ダウンサンプリングを採用しています(例:FLUX.1-dev、HunyuanVideo)。一方、Qwen-Image-2.0は16倍のダウンサンプリングを実現し、圧縮率を2倍にしています。

高い圧縮率は通常、細かいディテールを損なう原因となりますが、Qwenチームは2つの方法で対処しています。まず、圧縮器内のスキップ接続がボトルネック層の周りに細かい画像情報を運びます。次に、トレーニング中に潜在空間を整形し、意味的に意味のある構造をキャプチャすることで、画像モデルによりクリーンな「作業空間」を提供します。この調整圧力はトレーニングの初期段階でのみ強く、後半では弱められます。

さらに、QwenチームはほとんどのVAEで使用される識別器(discriminator)を完全に削除し、大規模トレーニングでは「ほとんど冗長」であり、トレーニングの不安定性の原因になると述べています。より積極的な圧縮にもかかわらず、このVAEは標準的なImageNetデータセットで、より緩やかな圧縮率を使用する競合よりも高い再構築スコアを記録しています。

Qwen-Image-2.0のコアは、テキストと画像トークンを単一のストリームで処理するマルチモーダル拡散Transformerです。テキスト条件は、重みが凍結されたビジョン言語モデルQwen3-VLから得られます。チームはTransformer自体に2つのアーキテクチャ変更を加えました。1つ目は内部スケーリングメカニズムの簡略化で、元の設計では学習された係数による乗算と学習されたオフセットの加算を行っていましたが、乗算のみが残っています。2つ目は、注意層間のフィードフォワードブロックをSwiGLUに置き換えたことです。

SwiGLUの導入は特定のトレーニング問題に起因します。モデルがテキストと画像を共同で学習する際、一部の内部値が極端な大きさに急増し、ニューロンがトレーニング初期に永久に飽和することがあります。大規模言語モデルの研究者はこれを「大規模活性化」と呼びます。SwiGLUは値を扱いやすい範囲に保ちます。

情報グラフィックやポスターのような複雑な出力には詳細なプロンプトが必要ですが、実際のユーザーは短く曖昧なリクエストを入力します。Qwen-Image-2.0は、このギャップを埋めるためにQwen3.5-9Bベースのアップストリームモジュールを採用し、簡潔な入力を豊かな説明に変換します。

このモジュールのトレーニングは異例の方法で行われました。既存の豊富な画像説明から出発し、照明、テクスチャ、レイアウトなどの詳細を体系的に削除し、各説明がカジュアルユーザーの入力のように読めるようにしました。削除ステップごとに自動的にトレーニング信号が生成され、欠落した詳細を追加するための「レシピ」が作成されました。

モジュールは2段階でトレーニングされます。まず、これらの合成ペアから学習します。次に、候補プロンプトを生成し、凍結された画像生成器で結果をレンダリングし、結果が良好で意図に合致するようにモジュールを最適化します。

人間の好みへの最終調整には、5つの独立した報酬モデルが使用されます。3つは新しく生成された画像の美学、プロンプト忠実度、肖像画品質を評価します。残りの2つは編集画像が指示にどれだけ従い、かつ元の画像から逸脱していないかを評価します。

強化学習セットアップにおいて注目すべき実用的なショートカットがあります。分類器フリーガイダンス(CFG)は、トレーニング例を生成するときのみ実行され、最適化ループ中は実行されません。これにより、品質に目に見える影響を与えることなく計算コストが削減されます。

チームはトレーニングデータを管理するための自己最適化パイプラインも構築しました。評価やユーザーフィードバックで不良出力が明らかになった場合、システムは自動的に各失敗を3つの根本原因のいずれかに分類します。強化学習に問題がある場合は報酬信号が調整され、モデルに知識が不足している場合はトレーニングデータのギャップを自動検索し、対象を絞った新しい例でパッチを適用します。プロンプトモジュールが弱点の場合は再トレーニングされます。人間は最終レビューとフィルタリングのみに関与します。

トレーニングデータは、画像解像度が256から2048ピクセルに段階的に上昇するにつれて、6段階を経ます。生成データと編集データの比率も、初期の9:1から後期の7:3へと変化します。

拡散モデルは通常、多数の小さなノイズ除去ステップを通じて画像を生成します。推論を高速化するために、チームは完全なモデルを軽量バージョンに蒸留し、40ステップではなく4ステップのみを必要とします。蒸留プロセスはステップごとの生成パスを再現しようとはせず、最終出力のみを一致させます。レポートによると、視覚品質は同等です。

Qwen-Image-2.0は今年初めに最初に発表された際、Alibaba Cloudの招待制APIベータとQwen Chat内のデモとしてのみ提供されました。Alibabaの社内LMArenaプラットフォームでのブラインド比較では、現在のリーダーに僅差で続いています。

オープンソースリリースについては未定です。重みはまだ公開されていませんが、Alibabaは最初のQwen画像モデルをローンチから約1ヶ月後にApache 2.0ライセンスで公開しました。Qwen-Image-2.0はまた、MeituanのLongCat画像やZhipu AIのGLM画像など、正確なテキストレンダリングを推進する中国画像モデルの急成長する波に加わっています。