跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

你看夠了:面向機器的質量約束影像編碼

文章摘要

arXiv 新論文提出一種質量約束的影像編碼方案:在保證人類觀察質量達到預設可接受水平後,把剩餘位元速率用於提升機器視覺任務表現。作者將聯合壓縮—分割訓練重構為約束最佳化問題,並設計絕對函式與雙線性函式兩種懲罰項;實驗顯示,在相同任務效能下,相比無約束聯合率—失真—任務最佳化和簡單率—失真基線,BD-rate 分別降低 22.82% 和 29.81%,且未增加複雜度。

來源arXiv Computer Vision作者: Khoa Pham-Dinh, Sanaz Nami, Hamed Rezazadegan Tavakoli, Moncef Gabbouj, Farhad Pakdaman
你看夠了:面向機器的質量約束影像編碼
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

arXiv 在 2026 年 9 月 20 日釋出了一篇題為《You've Seen Enough: Quality-Constrained Image Coding for Machines》的新論文,作者為 Khoa Pham-Dinh 等 5 人。論文編號為 arXiv:2609.25108v1,提交時間為當日 04:02:36 UTC,檔案大小約 7,810 KB,DOI 為 10.48550/arXiv.2609.25108。該工作屬於計算機視覺與模式識別(cs.CV)和人工智慧(cs.AI)方向。

論文關注的背景是,視覺資料正越來越多地被機器視覺系統消費,而不是供人類直接觀看。影像編碼 for machines(ICM)假設主要觀察者是計算機視覺應用,人類觀察者只負責檢查或驗證機器決策。受“恰可察覺失真”(just-noticeable distortion)啟發——即為人類觀察者設定剛好可接受的質量水平——作者希望把人眼可見質量限制在一個期望水平,從而把剩餘編碼容量用於改善機器任務效能。

為此,作者把聯合壓縮—分割訓練重新表述為一個約束最佳化問題:編解碼器必須滿足預先設定的可接受視覺質量目標,而任務項則消耗剩餘編碼容量。為了求解這一問題,他們設計懲罰函式來引導質量達到目標,並提出兩種形式:絕對函式,以及雙線性函式;後者在超過目標視覺質量後會施加更陡的斜率。

實驗結果顯示,在質量約束下,該方法相對於無約束的聯合率—失真—任務最佳化取得 -22.82% 的 BD-rate,相對於簡單的率—失真基線取得 -29.81% 的 BD-rate。這意味著在任務效能相同的情況下降低了位元速率。同時,編解碼器仍能以合理誤差達到目標視覺質量,並且沒有帶來額外的複雜度開銷。

論文目前可透過 arXiv 頁面訪問,提供 PDF、實驗性 HTML 和 TeX 原始碼等入口;瀏覽分類為 cs.CV,也可切換至 cs.AI 檢視。

展開要點與分析

文章情報

研究者進階

要點

  • 面向機器視覺的影像編碼(ICM)把機器而非人作為主要觀察者。
  • 核心思路是限制人類觀察質量到預設水平,將剩餘編碼容量用於提升機器任務效能。
  • 方法將聯合壓縮—分割訓練寫成約束最佳化,並用絕對函式與雙線性函式懲罰項引導質量達標。
  • 實驗報告 BD-rate 降低 22.82% 與 29.81%,且目標視覺質量誤差合理、無額外複雜度。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。