FUSE:透過自適應語義-幾何證據獲取實現主動功能可供性定位
本文提出主動功能可供性定位任務,要求具身智慧體透過順序探索場景來識別並空間定位滿足功能查詢的物體。作者提出FUSE框架,結合顯式不確定性驅動的探索與學習得到的攤銷規劃器,高效選擇資訊豐富的視角。在基於Habitat的基準上,FUSE實現了非oracle方法中的最優定位效能,計算開銷相比完全顯式探索降低1.33倍,且在多種可供性知識源下均保持有效性。
具身智慧體在真實環境中經常需要根據物體的功能而不是它的類別名稱來識別和操作。例如,當使用者說“幫我找一個能切東西的工具”時,智慧體不能只靠物體標籤,而必須巡視場景、收集證據,判斷哪個物體具備“切割”這個功能屬性。現有可供性定位方法大多在固定視角下工作,一旦功能性線索被遮擋、模糊或不完整,模型就無法決定該往哪裡看,導致定位失敗或需要大量冗餘掃描。針對這個缺口,周晨等人在 arXiv 提交的論文《FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition》中正式提出主動功能可供性定位任務,並給出一個名為 FUSE 的解決框架。
論文將主動功能可供性定位建模為序列決策問題:智慧體在一個場景中逐步移動、選擇新視角,最終找到並空間定位滿足給定功能查詢的物體。與靜態 affordance grounding 不同,智慧體需要根據已觀察到的資訊判斷哪些區域最可能包含功能證據,並在必要時接近物體、改變視角。FUSE 框架把兩種互補機制結合起來:一是顯式不確定性驅動的探索,它會計算當前語義-幾何證據的不確定性,優先觀察不確定性高的區域;二是學習得到的攤銷規劃器,它用網路快速預測下一步最有資訊量的視角,避免每一步都做重規劃。兩者配合形成自適應證據獲取策略,在有限的計算預算下提高定位效率。
為了驗證 FUSE,作者在 Habitat 模擬平臺上建立了新的評估基準。實驗結果顯示,在非 oracle 方法中 FUSE 達到最高的定位效能,同時相比完全顯式探索把計算量降低 1.33 倍。論文還測試了來自不同來源的功能可供性知識,FUSE 均能穩定工作,說明它不依賴某一種特定的知識表示,具備較好的泛化能力。
該論文當前處於審稿階段,全文 15 頁,包含 9 個表格和 3 張圖,研究方向涵蓋機器人學(cs.RO)和計算機視覺(cs.CV)。論文的 arXiv 編號為 2608.12683,於 2026 年 8 月 13 日提交,提交者資訊來自 Sathyanarayanan Aakur;arXiv 已為論文分配 DOI(透過 DataCite 登記)。如果後續程式碼和基準公開發布,將有助於推動具身智慧體在主動感知與功能理解方向上的研究進展。