arXiv 在 2026 年 9 月 20 日发布了一篇题为《You've Seen Enough: Quality-Constrained Image Coding for Machines》的新论文,作者为 Khoa Pham-Dinh 等 5 人。论文编号为 arXiv:2609.25108v1,提交时间为当日 04:02:36 UTC,文件大小约 7,810 KB,DOI 为 10.48550/arXiv.2609.25108。该工作属于计算机视觉与模式识别(cs.CV)和人工智能(cs.AI)方向。
论文关注的背景是,视觉数据正越来越多地被机器视觉系统消费,而不是供人类直接观看。图像编码 for machines(ICM)假设主要观察者是计算机视觉应用,人类观察者只负责检查或验证机器决策。受“恰可察觉失真”(just-noticeable distortion)启发——即为人类观察者设定刚好可接受的质量水平——作者希望把人眼可见质量限制在一个期望水平,从而把剩余编码容量用于改善机器任务性能。
为此,作者把联合压缩—分割训练重新表述为一个约束优化问题:编解码器必须满足预先设定的可接受视觉质量目标,而任务项则消耗剩余编码容量。为了求解这一问题,他们设计惩罚函数来引导质量达到目标,并提出两种形式:绝对函数,以及双线性函数;后者在超过目标视觉质量后会施加更陡的斜率。
实验结果显示,在质量约束下,该方法相对于无约束的联合率—失真—任务优化取得 -22.82% 的 BD-rate,相对于简单的率—失真基线取得 -29.81% 的 BD-rate。这意味着在任务性能相同的情况下降低了码率。同时,编解码器仍能以合理误差达到目标视觉质量,并且没有带来额外的复杂度开销。
论文目前可通过 arXiv 页面访问,提供 PDF、实验性 HTML 和 TeX 源码等入口;浏览分类为 cs.CV,也可切换至 cs.AI 查看。