arXiv 在 2026 年 9 月 20 日釋出了一篇題為《You've Seen Enough: Quality-Constrained Image Coding for Machines》的新論文,作者為 Khoa Pham-Dinh 等 5 人。論文編號為 arXiv:2609.25108v1,提交時間為當日 04:02:36 UTC,檔案大小約 7,810 KB,DOI 為 10.48550/arXiv.2609.25108。該工作屬於計算機視覺與模式識別(cs.CV)和人工智慧(cs.AI)方向。
論文關注的背景是,視覺資料正越來越多地被機器視覺系統消費,而不是供人類直接觀看。影像編碼 for machines(ICM)假設主要觀察者是計算機視覺應用,人類觀察者只負責檢查或驗證機器決策。受“恰可察覺失真”(just-noticeable distortion)啟發——即為人類觀察者設定剛好可接受的質量水平——作者希望把人眼可見質量限制在一個期望水平,從而把剩餘編碼容量用於改善機器任務效能。
為此,作者把聯合壓縮—分割訓練重新表述為一個約束最佳化問題:編解碼器必須滿足預先設定的可接受視覺質量目標,而任務項則消耗剩餘編碼容量。為了求解這一問題,他們設計懲罰函式來引導質量達到目標,並提出兩種形式:絕對函式,以及雙線性函式;後者在超過目標視覺質量後會施加更陡的斜率。
實驗結果顯示,在質量約束下,該方法相對於無約束的聯合率—失真—任務最佳化取得 -22.82% 的 BD-rate,相對於簡單的率—失真基線取得 -29.81% 的 BD-rate。這意味著在任務效能相同的情況下降低了位元速率。同時,編解碼器仍能以合理誤差達到目標視覺質量,並且沒有帶來額外的複雜度開銷。
論文目前可透過 arXiv 頁面訪問,提供 PDF、實驗性 HTML 和 TeX 原始碼等入口;瀏覽分類為 cs.CV,也可切換至 cs.AI 檢視。