跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

ImIR:用影像指令微調實現全能影像修復

文章摘要

ImIR 用源自退化影像本身的連續影像指令替代文本提示,為預訓練影像編輯模型提供條件;僅需在單張 GPU 上訓練約三小時的一個介面卡,即可覆蓋六項修復任務,並支援無需退化標籤的任務無關修復。

來源arXiv Computer Vision作者: S\"uleyman Aslan, G\"orkay Aydemir, M{\i}sra Yavuz, Yunus Bilge Kurt, Nasrin Rahimi, Ahmet Rasim Emirda\u{g}{\i}, Burak Can Biner, M. Ak{\i}n Y{\i}lmaz
ImIR:用影像指令微調實現全能影像修復
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

arXiv 於 2026 年 9 月 21 日釋出了一篇題為《ImIR: Image-Instruction Tuning for All-in-One Image Restoration》的論文,編號為 arXiv:2609.25267v1,屬於計算機視覺與模式識別(cs.CV)分類。作者為 Süleyman Aslan 及另外 7 位合作者,論文已被 ACCV 2026 接收。該工作關注一個現實問題:影像退化型別差異極大,因此實用的復原系統必須用單一模型處理多種退化。近期一種有效做法是:以小型低秩介面卡(low-rank adapter)配合文本提示,把大型預訓練影像編輯模型適配到復原任務上。ImIR 的核心改動是把這個文本提示替換成從退化影像本身推匯出的“影像指令”。具體而言,退化影像透過兩條路徑進入編輯器:其結構資訊來自模型自身的 VAE,而其語義指令來自一個輕量級 token mapper,該對映器把退化影像的視覺-語言嵌入向乾淨影像本應產生的嵌入方向偏移。由於指令是一個連續向量,對它進行縮放就能得到一族有效的復原結果,這對目標不唯一的任務尤其有用,例如低光增強——同一張低光圖可能存在多種合理亮度與風格。作者用單個介面卡把一個 Qwen-Image-Edit 模型適配到六項任務,訓練僅需約三小時、在一塊 GPU 上完成。在匹配條件下的比較中,影像指令優於文本條件;並且它支援無需退化標籤的任務無關復原,而文本版本做不到這一點。論文提交歷史顯示,v1 版本於 2026 年 9 月 21 日 18:15:08 UTC 提交,檔案大小約 3,558 KB,提交人為 Süleyman Aslan。頁面同時提供 PDF、實驗性 HTML、TeX 原始碼與檢視許可等連結;DOI 為 https://doi.org/10.48550/arXiv.2609.25267,由 DataCite 發放,但頁面註明 DOI 註冊尚在等待中。需要留意的是,當前可獲取的正文資訊以摘要與後設資料為主,摘要並未給出六項任務的具體名稱、定量指標、資料集規模、與基線方法的逐項對比數值,也未在正文中列出程式碼或資料連結;因此關於“影像指令優於文本條件”和“任務無關復原”的結論,應視為作者在論文中的報告,具體實驗設定與消融結果仍需查閱全文。同樣,約三小時、單 GPU 的訓練成本與六任務共用一個介面卡的設定,是摘要中的概括性描述,實際硬體型號、訓練資料構成與介面卡容量等細節未在摘要層面展開。總體來看,ImIR 提出了一條不同於文本提示的復原條件化路徑:讓退化影像自身產生連續語義指令,並透過縮放這一連續向量來覆蓋目標不唯一的復原任務族,從而在單一模型、單一介面卡與較短訓練時間下實現多工影像復原。

展開要點與分析

文章情報

工程師進階

要點

  • 用一個輕量 token 對映器把退化影像的視覺-語言嵌入推向乾淨影像應有的嵌入,從而生成影像指令。
  • 指令是連續向量,對其縮放可得到一族有效修復結果,適合低光照增強等目標不唯一的任務。
  • 單個介面卡在單張 GPU 上約三小時訓練,即讓 Qwen-Image-Edit 覆蓋六項修復任務。
  • 在匹配對比下影像指令優於文本條件,並能在沒有退化標籤的情況下實現任務無關修復。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。