LowAux-RDNet:低通残差监督与场景平衡的真实世界训练用于单幅图像反射去除
提出LowAux-RDNet,在RDNet基础上引入训练专用的低通反射辅助目标(LowAux),通过低频约束增强对多样化反射分布的平衡性能。结合RRW场景平衡的真实对,提升跨数据集泛化能力。在统一基准测试中,五数据集宏平均PSNR达27.546 dB,SSIM、NCC、LMSE均达到最优。
单幅图像反射去除是计算机视觉中的一个经典难题,旨在从透过玻璃拍摄的混合图像中分离出清晰的背景(透射层)。尽管现有方法在特定场景下表现良好,但面对多种反射类型(如弱反射、强反射、语义反射)时,往往难以保持均衡的性能。来自中国的研究团队提出了一种名为LowAux-RDNet的新方法,通过引入训练专用的低通反射辅助目标,显著提升了模型在不同反射分布下的鲁棒性和泛化能力。
LowAux-RDNet基于RDNet架构,该架构采用显式分解流水线将图像分解为反射层和透射层。创新之处在于LowAux——一个仅在训练阶段使用的低通反射辅助损失。传统方法中,残差目标直接监督反射层;而LowAux则对预测图和目标图进行对称滤波,得到其低频分量,从而为模型提供稳定的低频约束。这种设计不仅保留了原始残差监督的细节恢复能力,还引导模型关注全局反射模式,减少对高频噪声的过度拟合。由于LowAux仅参与训练,推理时无额外计算开销。
为了弥补合成数据与真实世界之间的差距,团队引入了RRW数据集中的场景平衡真实反射-透射对。RRW通过精心选择涵盖不同场景和反射强度的图像对,有效拓宽了训练数据的真实场景覆盖范围,提升了模型在跨数据集上的泛化表现。
在评估方面,以往研究中因模型专属的预处理(缩放、填充、输出量化)和度量代码差异导致比较不公平。为此,团队构建了一个统一的公开基准,包含CEILNet、Real20、Postcard、Objects和Wild五个常用数据集。基于相同评估器,LowAux-RDNet取得了五个数据集的宏平均PSNR为27.546 dB、SSIM为0.9220、NCC为0.9751、LMSE为0.004760,在所有比较的公开模型和内部变体中均达到最优。逐数据集和定性分析表明,该方法的主要优势在于跨反射分布的更平衡性能。不过,对于Postcard数据集中包含清晰语义反射(如文字、图案)的复杂情况,仍存在改善空间。
论文代码已公开,为后续研究提供了可复现的基准。这一工作不仅推动了反射去除技术的实用化,也为评估标准化树立了范例。