AI News HubLIVE
站內改寫2 分鐘閱讀

U-CFR:不確定性引導的級聯前向精煉用於交互式分割

U-CFR是一種新型交互式圖像分割框架,通過在推理過程中自主生成內部偽點擊來自我糾正,減少用户所需點擊次數。該方法引入邊界感知的不確定性分數,融合分割不確定性、輪廓梯度和顯式邊緣預測,引導偽點擊放置在模糊邊界區域。雙頭網絡包括分割頭和邊緣頭,通過級聯精煉步驟逐步優化掩膜。在標準數據集上,U-CFR將挑戰性數據集(如Berkeley)所需的點擊次數減少10%以上。

來源arXiv Computer Vision作者: Elijah Danquah Darko, Min Xian, Terence Soule, Tiankai Yao, Matthew William Anderson

U-CFR:不確定性引導的級聯前向精煉用於交互式分割

交互式圖像分割是計算機視覺領域的一項重要任務,旨在通過用户提供的點擊等交互信號,快速準確地從圖像中分割出目標對象。該技術在醫學影像分析、衞星圖像處理、自動駕駛感知以及圖像編輯等場景中具有廣泛的應用。然而,傳統的交互式分割方法通常存在兩個主要問題:一是需要用户提供大量且精確的糾正點擊,尤其是在處理複雜邊界或低對比度區域時;二是許多方法採用的被動精煉策略收斂緩慢,導致交互效率低下。為了解決這些挑戰,來自科研機構的研究人員提出了一種全新的推理時框架——不確定性引導的級聯前向精煉(Uncertainty-Guided Cascade Forward Refinement, U-CFR)。該框架的核心思想是讓模型在每次用户交互後,能夠自主評估當前分割結果的不確定性,並利用這些信息生成內部偽點擊進行自我糾正,從而減少對人工糾正的依賴。

U-CFR的創新之處在於其精心設計的邊界感知不確定性分數。該分數並非單一來源,而是綜合考慮了分割不確定性(即模型對該區域預測的置信度)、輪廓梯度(反映圖像邊緣強度)以及顯式的邊緣預測結果。通過融合這三種互補信息,U-CFR能夠準確定位那些最模糊的邊界區域——這些區域往往是分割錯誤的高發地帶。隨後,系統會在這些不確定性最高的位置自動生成偽點擊,作為後續精煉的強監督信號。這一過程完全自動化,無需用户介入,從而顯著提升了交互效率。

為了支持上述機制,研究團隊設計了一個雙頭網絡架構。該網絡包含一個共享的編碼器-解碼器骨幹,以及兩個功能明確的頭部:分割頭負責預測分割掩膜,確保區域內部的一致性;邊緣頭則專注於邊界預測,以增強分割結果的邊界對齊精度。在推理階段,U-CFR採用級聯精煉策略:每一步精煉中,首先根據當前掩膜計算不確定性分數並放置偽點擊,然後將這些點擊作為額外輸入送入網絡,得到更新後的掩膜。這一過程迭代進行多次,直至收斂。實驗結果表明,經過三級級聯精煉後,分割質量達到最優。

在標準基準數據集上的全面評估驗證了U-CFR的有效性。在Berkeley分割數據集(BSDS500)上,與現有方法相比,U-CFR將所需的用户點擊次數減少了超過10%,同時保持了更高的分割精度(如IOU指標)。在其他數據集如GrabCut和SBD上,U-CFR同樣取得了領先性能。此外,該方法在初始掩膜質量和邊界準確性方面也表現優異。這些成果表明,U-CFR不僅提升了交互效率,還改善了分割結果的細節質量。

該論文已被國際模式識別大會ICPR 2026接收。論文全文共12頁,包含3張圖表和4張表格,詳細介紹了方法的設計原理、實驗設置以及結果分析。研究人員表示,U-CFR為交互式分割提供了一種更智能、更高效的解決方案,未來將進一步探索其在視頻分割和3D分割中的應用潛力。