在制造业与服务机器人场景中,经常需要在没有标注训练集的情况下识别已导入的特定物体。传统方法通常依赖CAD模型作为可渲染的先验,然而现实中CAD模型常常缺失;两张二维图像也不提供形状先验,而冻结的视觉基础模型特征在低纹理、形状近似的工业零件上容易失效。这项研究提出用一段很短的目标中心扫描来补充图像本身,构建一种无需CAD的三维形状先验。
具体做法是:先用3D高斯泼溅(3DGS)重建每个待识别物体的点云,再按类别汇总为形状原型,并与冻结的DINOv2图像特征做固定权重融合。在HOPE(外形具有明显辨识度的家用物品)和T-LESS(外形容易混淆的无纹理工业零件)两类数据集上,作者对比了不同几何来源。结果显示,RGB-D深度(T-LESS上)、3DGS重建和CAD模型三种几何输入的性能基本持平:HOPE上三者打平,T-LESS上相差不超过1.6个百分点。也就是说,3DGS本身不是关键,真正的“识别价值”来自几何信息本身。
几何先验的收益大小取决于物体形状是否容易被区分。对于HOPE这样形状特征突出的物体,仅用几何就能达到0.920的识别分数,高于仅用图像的0.832;而固定权重融合为0.872,处于二者之间,没有超过纯几何所代表的天花板。对于T-LESS这种低纹理、形状相似的工业件,纯几何或纯图像分别约为0.560,融合后提升到0.591,虽然幅度不大但持续稳定,说明它确实给单一信号提供了增量。更有趣的是,这个先验是互补而非均匀叠加:它修复图像识别失败的情况远比破坏已有成功多,而且在部分遮挡条件下收益会进一步增大。
研究还专门检验了“渲染图像”的作用。作者发现,把3DGS的渲染图直接喂给图像模型并不能帮助识别,而冻结特征本身的识别能力几乎不受光照变化影响,光照不同造成的结果差异在2.5个百分点以内。这进一步说明,先验的价值来自真实几何,不是生成出来的外观像素。需要强调的是,本研究的范围限于物体识别任务,并不涉及BOP位姿估计基准。论文共19页,含11张图和5张表,于2026年9月3日提交至arXiv(编号2609.04381),主题涵盖计算机视觉、人工智能与机器人学。