本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

ImIR:画像インストラクションによるチューニングでオールインワン画像復元を実現

記事の要約

ImIR は、事前学習済み画像編集モデルに与える条件付けを、劣化画像そのものから導いた連続的な画像インストラクションに置き換える手法。単一 GPU で約3時間訓練した1つのアダプタで6種類の復元タスクをカバーし、劣化ラベルなしのタスク非依存な復元も可能にする。

ソースarXiv Computer Vision著者: S\"uleyman Aslan, G\"orkay Aydemir, M{\i}sra Yavuz, Yunus Bilge Kurt, Nasrin Rahimi, Ahmet Rasim Emirda\u{g}{\i}, Burak Can Biner, M. Ak{\i}n Y{\i}lmaz
ImIR:画像インストラクションによるチューニングでオールインワン画像復元を実現
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

画像の劣化はきわめて多様である。ノイズ、ぼけ、圧縮歪み、低照度など種類はさまざまで、実用的な復元システムは1つのモデルで多数の劣化タイプに対処できなければならない。2026年9月21日に arXiv へ投稿された論文(arXiv:2609.25267、ACCV 2026 に採択)は ImIR を提案し、これまで用いられてきたテキストプロンプトに代えて、劣化画像そのものから導かれる「画像インストラクション」を導入した。

従来の有効なレシピは、大規模な事前学習済み画像編集モデルを小さな低ランクアダプタで復元向けに適応させ、そこにテキストプロンプトを与えるというものだった。ImIR の要点は、このプロンプトを劣化画像自体から生成されるインストラクションへ置き換えた点にある。人間が書いたテキスト記述に依存せず、画像に埋め込まれた情報からタスクを指示できる。

画像は2つの経路で編集モデルへ渡される。構造情報はモデルが持つ VAE から供給され、意味的なインストラクションは軽量なトークンマッパーから供給される。このマッパーは、劣化画像の視覚言語埋め込みを、クリーンな画像が生み出すはずの埋め込みへと近づける役割を担う。これにより「どこがどう劣化しているか」「どう復元されるべきか」が1つのベクトルに符号化される。

インストラクションは離散的なテキストではなく連続ベクトルであるため、これをスケーリングすると、妥当な復元結果の系列が得られる。低照度強調のように、明るさをどれだけ持ち上げるかという正解が一意に定まらないタスクでは、この連続的な調整が特に有用であり、テキスト条件付けでは同等の柔軟性を得にくい。

実験では、1つのアダプタのみを用いて Qwen-Image-Edit を6つの異なる復元タスクへ適応させ、訓練は単一 GPU 上で約3時間で完了した。条件を揃えた比較では、画像インストラクションはテキスト条件付けを上回った。さらに重要な点として、劣化ラベルを必要としないタスク非依存の復元を可能にしており、これはテキスト版では実現できない。論文は Süleyman Aslan 氏ら8名の著者によるもので、コンピュータビジョンとパターン認識(cs.CV)に分類されている。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 軽量なトークンマッパーが劣化画像の視覚言語埋め込みをクリーン画像の埋め込みへと近づけ、画像インストラクションを生成する。
  • インストラクションは連続ベクトルであり、スケーリングによって低照度強調など正解が一意でないタスクで有効な復元の系列を得られる。
  • 1つのアダプタを単一 GPU で約3時間訓練するだけで、Qwen-Image-Edit を6つの復元タスクに適応できる。
  • 条件を揃えた比較で画像インストラクションはテキスト条件付けを上回り、劣化ラベルなしのタスク非依存復元を可能にする。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。