arXiv 於 2026 年 9 月 21 日發佈了一篇題為《ImIR: Image-Instruction Tuning for All-in-One Image Restoration》的論文,編號為 arXiv:2609.25267v1,屬於計算機視覺與模式識別(cs.CV)分類。作者為 Süleyman Aslan 及另外 7 位合作者,論文已被 ACCV 2026 接收。該工作關注一個現實問題:圖像退化類型差異極大,因此實用的復原系統必須用單一模型處理多種退化。近期一種有效做法是:以小型低秩適配器(low-rank adapter)配合文本提示,把大型預訓練圖像編輯模型適配到復原任務上。ImIR 的核心改動是把這個文本提示替換成從退化圖像本身推導出的“圖像指令”。具體而言,退化圖像通過兩條路徑進入編輯器:其結構信息來自模型自身的 VAE,而其語義指令來自一個輕量級 token mapper,該映射器把退化圖像的視覺-語言嵌入向乾淨圖像本應產生的嵌入方向偏移。由於指令是一個連續向量,對它進行縮放就能得到一族有效的復原結果,這對目標不唯一的任務尤其有用,例如低光增強——同一張低光圖可能存在多種合理亮度與風格。作者用單個適配器把一個 Qwen-Image-Edit 模型適配到六項任務,訓練僅需約三小時、在一塊 GPU 上完成。在匹配條件下的比較中,圖像指令優於文本條件;並且它支持無需退化標籤的任務無關復原,而文本版本做不到這一點。論文提交歷史顯示,v1 版本於 2026 年 9 月 21 日 18:15:08 UTC 提交,文件大小約 3,558 KB,提交人為 Süleyman Aslan。頁面同時提供 PDF、實驗性 HTML、TeX 源碼與查看許可等鏈接;DOI 為 https://doi.org/10.48550/arXiv.2609.25267,由 DataCite 發放,但頁面註明 DOI 註冊尚在等待中。需要留意的是,當前可獲取的正文信息以摘要與元數據為主,摘要並未給出六項任務的具體名稱、定量指標、數據集規模、與基線方法的逐項對比數值,也未在正文中列出代碼或數據鏈接;因此關於“圖像指令優於文本條件”和“任務無關復原”的結論,應視為作者在論文中的報告,具體實驗設置與消融結果仍需查閲全文。同樣,約三小時、單 GPU 的訓練成本與六任務共用一個適配器的設定,是摘要中的概括性描述,實際硬件型號、訓練數據構成與適配器容量等細節未在摘要層面展開。總體來看,ImIR 提出了一條不同於文本提示的復原條件化路徑:讓退化圖像自身產生連續語義指令,並通過縮放這一連續向量來覆蓋目標不唯一的復原任務族,從而在單一模型、單一適配器與較短訓練時間下實現多任務圖像復原。
ImIR:用圖像指令微調實現全能圖像修復
文章摘要
ImIR 用源自退化圖像本身的連續圖像指令替代文本提示,為預訓練圖像編輯模型提供條件;僅需在單張 GPU 上訓練約三小時的一個適配器,即可覆蓋六項修復任務,並支持無需退化標籤的任務無關修復。
來源arXiv Computer Vision作者: S\"uleyman Aslan, G\"orkay Aydemir, M{\i}sra Yavuz, Yunus Bilge Kurt, Nasrin Rahimi, Ahmet Rasim Emirda\u{g}{\i}, Burak Can Biner, M. Ak{\i}n Y{\i}lmaz
ImIR:用圖像指令微調實現全能圖像修復