AI News HubLIVE
站内改写1 分钟阅读

M2Retinexformer: 用于低光图像增强的多模态Retinexformer

M2Retinexformer是一种新型多模态低光图像增强框架,在Retinexformer基础上融入深度、亮度和语义信息,通过渐进式精炼管道和自适应门控机制提升性能。在LOL、SID、SMID和SDSD基准上优于现有方法。

来源arXiv Computer Vision作者: Youssef Aboelwafa, Hicham G. Elmongui, Marwan Torki

低光图像增强是计算机视觉领域的一项基础且具有挑战性的任务。由于光照不足,图像往往遭受复杂的退化,包括放大噪声、伪影和颜色失真。近年来,基于Retinex理论的深度学习方法取得了显著进展,但大多数方法仅依赖于单模态RGB信息,忽略了深度、亮度分布和场景语义等关键几何与语义线索。这些线索在复杂照明条件下对于图像恢复至关重要。

为了解决这一问题,来自Youssef Aboelwafa及其合作者的研究团队提出了M2Retinexformer(多模态Retinexformer),这是一种创新的框架,在Retinexformer的基础上整合了多模态信息。该框架通过渐进式精炼管道,分别引入深度线索(提供与光照无关的几何上下文)、亮度先验(显式指导亮度分布)和语义特征(辅助场景理解)。深度信息来自深度估计网络,亮度先验通过统计方法计算,语义特征则利用预训练的分割网络提取。这些模态信息在多尺度下被提取,并通过交叉注意力机制进行融合。更重要的是,自适应门控模块会根据辅助线索的可靠性动态平衡照明引导的自注意力与交叉注意力,从而避免不可靠线索的负面影响。

在多个基准数据集上的实验证明了M2Retinexformer的有效性。在LOL、SID、SMID和SDSD这四个广泛使用的低光增强数据集上,该方法均取得了优于Retinexformer和当前最先进方法的性能。例如,在LOL数据集上,PSNR指标提升了0.8 dB以上,SSIM也有显著改善。这些改进在视觉质量上表现为更清晰的细节、更自然的色彩和更少的噪声。

此外,研究者提供了开源代码和预训练权重,便于其他研究者复现和进一步探索。论文已被2026年IEEE国际图像处理大会(ICIP)接收,这进一步证明了其学术价值。该工作不仅推动了低光图像增强技术的发展,也为其他需要多模态信息的视觉任务提供了新思路。