跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

你看夠了:面向機器的質量約束圖像編碼

文章摘要

arXiv 新論文提出一種質量約束的圖像編碼方案:在保證人類觀察質量達到預設可接受水平後,把剩餘碼率用於提升機器視覺任務表現。作者將聯合壓縮—分割訓練重構為約束優化問題,並設計絕對函數與雙線性函數兩種懲罰項;實驗顯示,在相同任務性能下,相比無約束聯合率—失真—任務優化和簡單率—失真基線,BD-rate 分別降低 22.82% 和 29.81%,且未增加複雜度。

來源arXiv Computer Vision作者: Khoa Pham-Dinh, Sanaz Nami, Hamed Rezazadegan Tavakoli, Moncef Gabbouj, Farhad Pakdaman
你看夠了:面向機器的質量約束圖像編碼
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

arXiv 在 2026 年 9 月 20 日發佈了一篇題為《You've Seen Enough: Quality-Constrained Image Coding for Machines》的新論文,作者為 Khoa Pham-Dinh 等 5 人。論文編號為 arXiv:2609.25108v1,提交時間為當日 04:02:36 UTC,文件大小約 7,810 KB,DOI 為 10.48550/arXiv.2609.25108。該工作屬於計算機視覺與模式識別(cs.CV)和人工智能(cs.AI)方向。

論文關注的背景是,視覺數據正越來越多地被機器視覺系統消費,而不是供人類直接觀看。圖像編碼 for machines(ICM)假設主要觀察者是計算機視覺應用,人類觀察者只負責檢查或驗證機器決策。受“恰可察覺失真”(just-noticeable distortion)啓發——即為人類觀察者設定剛好可接受的質量水平——作者希望把人眼可見質量限制在一個期望水平,從而把剩餘編碼容量用於改善機器任務性能。

為此,作者把聯合壓縮—分割訓練重新表述為一個約束優化問題:編解碼器必須滿足預先設定的可接受視覺質量目標,而任務項則消耗剩餘編碼容量。為了求解這一問題,他們設計懲罰函數來引導質量達到目標,並提出兩種形式:絕對函數,以及雙線性函數;後者在超過目標視覺質量後會施加更陡的斜率。

實驗結果顯示,在質量約束下,該方法相對於無約束的聯合率—失真—任務優化取得 -22.82% 的 BD-rate,相對於簡單的率—失真基線取得 -29.81% 的 BD-rate。這意味着在任務性能相同的情況下降低了碼率。同時,編解碼器仍能以合理誤差達到目標視覺質量,並且沒有帶來額外的複雜度開銷。

論文目前可通過 arXiv 頁面訪問,提供 PDF、實驗性 HTML 和 TeX 源碼等入口;瀏覽分類為 cs.CV,也可切換至 cs.AI 查看。

展開要點與分析

文章情報

研究者進階

要點

  • 面向機器視覺的圖像編碼(ICM)把機器而非人作為主要觀察者。
  • 核心思路是限制人類觀察質量到預設水平,將剩餘編碼容量用於提升機器任務性能。
  • 方法將聯合壓縮—分割訓練寫成約束優化,並用絕對函數與雙線性函數懲罰項引導質量達標。
  • 實驗報告 BD-rate 降低 22.82% 與 29.81%,且目標視覺質量誤差合理、無額外複雜度。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。