在製造業與服務機器人場景中,經常需要在沒有標註訓練集的情況下識別已匯入的特定物體。傳統方法通常依賴CAD模型作為可渲染的先驗,然而現實中CAD模型常常缺失;兩張二維影像也不提供形狀先驗,而凍結的視覺基礎模型特徵在低紋理、形狀近似的工業零件上容易失效。這項研究提出用一段很短的目標中心掃描來補充影像本身,構建一種無需CAD的三維形狀先驗。
具體做法是:先用3D高斯潑濺(3DGS)重建每個待識別物體的點雲,再按類別彙總為形狀原型,並與凍結的DINOv2影像特徵做固定權重融合。在HOPE(外形具有明顯辨識度的家用物品)和T-LESS(外形容易混淆的無紋理工業零件)兩類資料集上,作者對比了不同幾何來源。結果顯示,RGB-D深度(T-LESS上)、3DGS重建和CAD模型三種幾何輸入的效能基本持平:HOPE上三者打平,T-LESS上相差不超過1.6個百分點。也就是說,3DGS本身不是關鍵,真正的“識別價值”來自幾何資訊本身。
幾何先驗的收益大小取決於物體形狀是否容易被區分。對於HOPE這樣形狀特徵突出的物體,僅用幾何就能達到0.920的識別分數,高於僅用影像的0.832;而固定權重融合為0.872,處於二者之間,沒有超過純幾何所代表的天花板。對於T-LESS這種低紋理、形狀相似的工業件,純幾何或純影像分別約為0.560,融合後提升到0.591,雖然幅度不大但持續穩定,說明它確實給單一訊號提供了增量。更有趣的是,這個先驗是互補而非均勻疊加:它修復影像識別失敗的情況遠比破壞已有成功多,而且在部分遮擋條件下收益會進一步增大。
研究還專門檢驗了“渲染影像”的作用。作者發現,把3DGS的渲染圖直接餵給影像模型並不能幫助識別,而凍結特徵本身的識別能力幾乎不受光照變化影響,光照不同造成的結果差異在2.5個百分點以內。這進一步說明,先驗的價值來自真實幾何,不是生成出來的外觀畫素。需要強調的是,本研究的範圍限於物體識別任務,並不涉及BOP位姿估計基準。論文共19頁,含11張圖和5張表,於2026年9月3日提交至arXiv(編號2609.04381),主題涵蓋計算機視覺、人工智慧與機器人學。