线缆、电线等可变形线性物体的实例分割,在机器人操作、线束装配、电力巡检、工厂自动化等场景中常常是感知系统的关键环节。与刚性物体不同,线缆可以自由弯曲、缠绕,也会在自重和接触作用下发生连续形变,因此外观变化极大且容易出现自遮挡。要从图像中把一根根线缆彼此分开并给出实例级掩码,模型需要同时理解拓扑结构和物理边界,这远远超出了普通语义分割的难度。更现实的问题是,在真实场景中获取大量实例级标注非常昂贵:一根线缆往往横跨大半个画面,标注人员需要逐点追踪它的轮廓,成本高昂且容易出错,导致社区长期缺乏高质量数据来训练和评估该方向的算法。
为填补这一空缺,Zilin Dai 与三位合作者提出了 WireSeg-32k 数据集。该数据集包含 32,000 张 RGB 合成图像,以及配套的实例掩码和深度图;同时,作者还提供了一个带像素级标注的真实世界测试集,用于评估模型从合成数据到真实场景的迁移能力。数据集生成的核心是 DeformX 协同仿真管线。DeformX 将 Cosserat 杆动力学与 Isaac Sim 的照片级渲染相结合:Cosserat 杆模型可以精确描述细长弹性杆在弯折、扭转、拉伸和接触中的力学行为,保证线缆形态符合物理规律;Isaac Sim 则以高质量光栅化和光线追踪生成多样化的场景光照与材质外观。通过二者的耦合,WireSeg-32k 中的线缆不仅形态上接近真实,而且其接触点、悬挂弧度和遮挡关系都与物理模拟结果一致,为模型提供了可学习的、自洽的几何线索。此外,管线采用基于 CAD 的线缆资产,并注入不同的背景、相机视角和照明条件,使得训练数据在保持真实性的同时兼顾视觉多样性。
论文用一组基线实验验证了数据的实用价值。作者直接使用 WireSeg-32k 对 SAM3 进行 LoRA 微调,没有引入复杂的域适应网络或额外的训练技巧。结果是,微调后的 SAM3 在真实世界测试集上的 mAP@75 比未经过微调的原始模型高出 10.2%。这个提升说明了两个问题:一是合成数据确实能够桥接 sim-to-real 差距,二是物理一致性比单纯的图像逼真更有助于模型理解线缆的结构。假如只是把线缆渲染得好看而忽略真实变形规律,模型很难在真实弯曲和接触情况下保持同样好的分割效果。
这篇论文于 2026 年 9 月 2 日提交至 arXiv(编号 2609.03102),投稿者为 Xiang Fei,作者信息显示为 Zilin Dai 与另外三人。论文带有“Synthetic Data for Computer Vision @ CVPR 2026 Workshop”的评论标记,说明已被该 CVPR 研讨会接收,研究分类为计算机视觉与模式识别(cs.CV)。目前 arXiv 页面提供了 PDF、HTML(实验性)以及 TeX 源文件,读者可以按需获取更多的实现细节、可视化结果和后续更新。