跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

ImIR:用图像指令微调实现全能图像修复

文章摘要

ImIR 用源自退化图像本身的连续图像指令替代文本提示,为预训练图像编辑模型提供条件;仅需在单张 GPU 上训练约三小时的一个适配器,即可覆盖六项修复任务,并支持无需退化标签的任务无关修复。

来源arXiv Computer Vision作者: S\"uleyman Aslan, G\"orkay Aydemir, M{\i}sra Yavuz, Yunus Bilge Kurt, Nasrin Rahimi, Ahmet Rasim Emirda\u{g}{\i}, Burak Can Biner, M. Ak{\i}n Y{\i}lmaz
ImIR:用图像指令微调实现全能图像修复
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

arXiv 于 2026 年 9 月 21 日发布了一篇题为《ImIR: Image-Instruction Tuning for All-in-One Image Restoration》的论文,编号为 arXiv:2609.25267v1,属于计算机视觉与模式识别(cs.CV)分类。作者为 Süleyman Aslan 及另外 7 位合作者,论文已被 ACCV 2026 接收。该工作关注一个现实问题:图像退化类型差异极大,因此实用的复原系统必须用单一模型处理多种退化。近期一种有效做法是:以小型低秩适配器(low-rank adapter)配合文本提示,把大型预训练图像编辑模型适配到复原任务上。ImIR 的核心改动是把这个文本提示替换成从退化图像本身推导出的“图像指令”。具体而言,退化图像通过两条路径进入编辑器:其结构信息来自模型自身的 VAE,而其语义指令来自一个轻量级 token mapper,该映射器把退化图像的视觉-语言嵌入向干净图像本应产生的嵌入方向偏移。由于指令是一个连续向量,对它进行缩放就能得到一族有效的复原结果,这对目标不唯一的任务尤其有用,例如低光增强——同一张低光图可能存在多种合理亮度与风格。作者用单个适配器把一个 Qwen-Image-Edit 模型适配到六项任务,训练仅需约三小时、在一块 GPU 上完成。在匹配条件下的比较中,图像指令优于文本条件;并且它支持无需退化标签的任务无关复原,而文本版本做不到这一点。论文提交历史显示,v1 版本于 2026 年 9 月 21 日 18:15:08 UTC 提交,文件大小约 3,558 KB,提交人为 Süleyman Aslan。页面同时提供 PDF、实验性 HTML、TeX 源码与查看许可等链接;DOI 为 https://doi.org/10.48550/arXiv.2609.25267,由 DataCite 发放,但页面注明 DOI 注册尚在等待中。需要留意的是,当前可获取的正文信息以摘要与元数据为主,摘要并未给出六项任务的具体名称、定量指标、数据集规模、与基线方法的逐项对比数值,也未在正文中列出代码或数据链接;因此关于“图像指令优于文本条件”和“任务无关复原”的结论,应视为作者在论文中的报告,具体实验设置与消融结果仍需查阅全文。同样,约三小时、单 GPU 的训练成本与六任务共用一个适配器的设定,是摘要中的概括性描述,实际硬件型号、训练数据构成与适配器容量等细节未在摘要层面展开。总体来看,ImIR 提出了一条不同于文本提示的复原条件化路径:让退化图像自身产生连续语义指令,并通过缩放这一连续向量来覆盖目标不唯一的复原任务族,从而在单一模型、单一适配器与较短训练时间下实现多任务图像复原。

展开要点与分析

文章情报

工程师进阶

要点

  • 用一个轻量 token 映射器把退化图像的视觉-语言嵌入推向干净图像应有的嵌入,从而生成图像指令。
  • 指令是连续向量,对其缩放可得到一族有效修复结果,适合低光照增强等目标不唯一的任务。
  • 单个适配器在单张 GPU 上约三小时训练,即让 Qwen-Image-Edit 覆盖六项修复任务。
  • 在匹配对比下图像指令优于文本条件,并能在没有退化标签的情况下实现任务无关修复。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。