画像の劣化はきわめて多様である。ノイズ、ぼけ、圧縮歪み、低照度など種類はさまざまで、実用的な復元システムは1つのモデルで多数の劣化タイプに対処できなければならない。2026年9月21日に arXiv へ投稿された論文(arXiv:2609.25267、ACCV 2026 に採択)は ImIR を提案し、これまで用いられてきたテキストプロンプトに代えて、劣化画像そのものから導かれる「画像インストラクション」を導入した。
従来の有効なレシピは、大規模な事前学習済み画像編集モデルを小さな低ランクアダプタで復元向けに適応させ、そこにテキストプロンプトを与えるというものだった。ImIR の要点は、このプロンプトを劣化画像自体から生成されるインストラクションへ置き換えた点にある。人間が書いたテキスト記述に依存せず、画像に埋め込まれた情報からタスクを指示できる。
画像は2つの経路で編集モデルへ渡される。構造情報はモデルが持つ VAE から供給され、意味的なインストラクションは軽量なトークンマッパーから供給される。このマッパーは、劣化画像の視覚言語埋め込みを、クリーンな画像が生み出すはずの埋め込みへと近づける役割を担う。これにより「どこがどう劣化しているか」「どう復元されるべきか」が1つのベクトルに符号化される。
インストラクションは離散的なテキストではなく連続ベクトルであるため、これをスケーリングすると、妥当な復元結果の系列が得られる。低照度強調のように、明るさをどれだけ持ち上げるかという正解が一意に定まらないタスクでは、この連続的な調整が特に有用であり、テキスト条件付けでは同等の柔軟性を得にくい。
実験では、1つのアダプタのみを用いて Qwen-Image-Edit を6つの異なる復元タスクへ適応させ、訓練は単一 GPU 上で約3時間で完了した。条件を揃えた比較では、画像インストラクションはテキスト条件付けを上回った。さらに重要な点として、劣化ラベルを必要としないタスク非依存の復元を可能にしており、これはテキスト版では実現できない。論文は Süleyman Aslan 氏ら8名の著者によるもので、コンピュータビジョンとパターン認識(cs.CV)に分類されている。