arXiv は 2026 年 9 月 20 日、Khoa Pham-Dinh 氏ら 5 名による論文「You've Seen Enough: Quality-Constrained Image Coding for Machines」を公開した。論文番号は arXiv:2609.25108v1、投稿日時は同日 04:02:36 UTC、ファイルサイズは約 7,810 KB、DOI は 10.48550/arXiv.2609.25108 である。分野は Computer Vision and Pattern Recognition(cs.CV)と Artificial Intelligence(cs.AI)にまたがる。
背景として、視覚データは人間の観察者よりも機械視覚システムによって消費されることが増えている。Image Coding for Machines(ICM)は、主たる観察者をコンピュータビジョン応用とみなし、人間の観察者はその判断を検査・検証する立場にあると仮定して画像を圧縮する。著者らは、人間にとってちょうど許容できる品質を設定する just-noticeable distortion に着想を得て、人間が観察する品質を所望のレベルに制限し、残りの符号化容量を機械性能の改善に使うことを目指した。
そのために、圧縮とセグメンテーションの同時訓練を制約付き最適化問題として再定式化する。コーデックは事前定義された許容可能な目標視覚品質を満たしつつ、タスク項が残りの符号化容量を消費する。これを解くため、品質を目標へ導くペナルティ関数を設計し、絶対関数と双線形関数の二つを提案した。双線形関数は、目標視覚品質を超えた時点でより急な傾きを適用する。
実験では、品質制約下で提案手法が無制約の joint rate–distortion–task 最適化に対して -22.82%、単純な rate–distortion ベースラインに対して -29.81% の BD レートを達成した。これは同一タスク性能を保ちながらビットレートを削減できることを示す。また、コーデックは目標視覚品質を妥当な誤差で満たし、複雑さのオーバーヘッドも追加しない。論文は PDF、実験的 HTML、TeX ソースなどで閲覧でき、閲覧コンテキストは cs.CV、cs.AI への切り替えも可能である。