CROP:通过构图推理和偏好优化实现专家级图像裁剪
提出一种新范式,将美学图像裁剪重构为多模态推理任务,通过“分析-提案-决策”过程激活视觉语言模型在美学方面的分析和理解能力,并结合专家偏好对齐模块,使裁剪结果与人类专家一致。实验证明该方法优于现有技术。
近日,一篇题为《CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference》的论文在arXiv上发表,提出了一种创新的图像裁剪方法,旨在通过模仿专业摄影师的分析过程来提升图像美学质量。该研究由Zhitong Dong等人完成,于2026年5月9日提交。
传统的图像裁剪方法主要依赖显著性预测或检索增强,但这些方法往往忽视了构图和美学的深层理解。显著性方法在复杂场景中难以做出构图权衡,而检索方法则机械地参考相似案例,缺乏对独特场景的适应能力。因此,这些方法的自动裁剪结果与人类专家之间存在显著差距。
针对这一问题,研究团队提出了一种新的范式,将美学图像裁剪重构为多模态推理任务。他们设计了一种名为CROP(Compositional Reasoning and Optimizing Preference)的方法,该方法引导视觉语言模型(VLM)像专业摄影师一样思考。CROP将复杂主观的美学问题分解为“分析-提案-决策”过程:首先分析场景中的元素和构图原则,然后提出多种裁剪方案,最后根据美学标准做出最优决策。此外,研究团队还引入了一个专家偏好对齐模块,通过训练使模型的决策与人类专家的审美保持一致。
实验在多个公开数据集上进行,结果表明CROP方法在美学质量上显著优于现有方法,包括基于显著性和检索的方法。消融实验验证了各组件(尤其是推理过程和偏好对齐)的有效性。该研究为自动图像裁剪领域提供了新的思路,有望在图像编辑、摄影辅助、社交平台缩略图生成等场景中得到广泛应用。