AI News HubLIVE
站內改寫2 分鐘閱讀

U-CFR:不確定性引導的級聯前向精煉用於互動式分割

U-CFR是一種新型互動式影像分割框架,透過在推理過程中自主生成內部偽點選來自我糾正,減少使用者所需點選次數。該方法引入邊界感知的不確定性分數,融合分割不確定性、輪廓梯度和顯式邊緣預測,引導偽點選放置在模糊邊界區域。雙頭網路包括分割頭和邊緣頭,透過級聯精煉步驟逐步最佳化掩膜。在標準資料集上,U-CFR將挑戰性資料集(如Berkeley)所需的點選次數減少10%以上。

來源arXiv Computer Vision作者: Elijah Danquah Darko, Min Xian, Terence Soule, Tiankai Yao, Matthew William Anderson

U-CFR:不確定性引導的級聯前向精煉用於互動式分割

互動式影像分割是計算機視覺領域的一項重要任務,旨在透過使用者提供的點選等互動訊號,快速準確地從影像中分割出目標物件。該技術在醫學影像分析、衛星影像處理、自動駕駛感知以及影像編輯等場景中具有廣泛的應用。然而,傳統的互動式分割方法通常存在兩個主要問題:一是需要使用者提供大量且精確的糾正點選,尤其是在處理複雜邊界或低對比度區域時;二是許多方法採用的被動精煉策略收斂緩慢,導致互動效率低下。為了解決這些挑戰,來自科研機構的研究人員提出了一種全新的推理時框架——不確定性引導的級聯前向精煉(Uncertainty-Guided Cascade Forward Refinement, U-CFR)。該框架的核心思想是讓模型在每次使用者互動後,能夠自主評估當前分割結果的不確定性,並利用這些資訊生成內部偽點選進行自我糾正,從而減少對人工糾正的依賴。

U-CFR的創新之處在於其精心設計的邊界感知不確定性分數。該分數並非單一來源,而是綜合考慮了分割不確定性(即模型對該區域預測的置信度)、輪廓梯度(反映影像邊緣強度)以及顯式的邊緣預測結果。透過融合這三種互補資訊,U-CFR能夠準確定位那些最模糊的邊界區域——這些區域往往是分割錯誤的高發地帶。隨後,系統會在這些不確定性最高的位置自動生成偽點選,作為後續精煉的強監督訊號。這一過程完全自動化,無需使用者介入,從而顯著提升了互動效率。

為了支援上述機制,研究團隊設計了一個雙頭網路架構。該網路包含一個共享的編碼器-解碼器骨幹,以及兩個功能明確的頭部:分割頭負責預測分割掩膜,確保區域內部的一致性;邊緣頭則專注於邊界預測,以增強分割結果的邊界對齊精度。在推理階段,U-CFR採用級聯精煉策略:每一步精煉中,首先根據當前掩膜計算不確定性分數並放置偽點選,然後將這些點選作為額外輸入送入網路,得到更新後的掩膜。這一過程迭代進行多次,直至收斂。實驗結果表明,經過三級級聯精煉後,分割質量達到最優。

在標準基準資料集上的全面評估驗證了U-CFR的有效性。在Berkeley分割資料集(BSDS500)上,與現有方法相比,U-CFR將所需的使用者點選次數減少了超過10%,同時保持了更高的分割精度(如IOU指標)。在其他資料集如GrabCut和SBD上,U-CFR同樣取得了領先效能。此外,該方法在初始掩膜質量和邊界準確性方面也表現優異。這些成果表明,U-CFR不僅提升了互動效率,還改善了分割結果的細節質量。

該論文已被國際模式識別大會ICPR 2026接收。論文全文共12頁,包含3張圖表和4張表格,詳細介紹了方法的設計原理、實驗設定以及結果分析。研究人員表示,U-CFR為互動式分割提供了一種更智慧、更高效的解決方案,未來將進一步探索其在影片分割和3D分割中的應用潛力。