線纜、電線等可變形線性物體的實例分割,在機器人操作、線束裝配、電力巡檢、工廠自動化等場景中常常是感知系統的關鍵環節。與剛性物體不同,線纜可以自由彎曲、纏繞,也會在自重和接觸作用下發生連續形變,因此外觀變化極大且容易出現自遮擋。要從圖像中把一根根線纜彼此分開並給出實例級掩碼,模型需要同時理解拓撲結構和物理邊界,這遠遠超出了普通語義分割的難度。更現實的問題是,在真實場景中獲取大量實例級標註非常昂貴:一根線纜往往橫跨大半個畫面,標註人員需要逐點追蹤它的輪廓,成本高昂且容易出錯,導致社區長期缺乏高質量數據來訓練和評估該方向的算法。
為填補這一空缺,Zilin Dai 與三位合作者提出了 WireSeg-32k 數據集。該數據集包含 32,000 張 RGB 合成圖像,以及配套的實例掩碼和深度圖;同時,作者還提供了一個帶像素級標註的真實世界測試集,用於評估模型從合成數據到真實場景的遷移能力。數據集生成的核心是 DeformX 協同仿真管線。DeformX 將 Cosserat 杆動力學與 Isaac Sim 的照片級渲染相結合:Cosserat 杆模型可以精確描述細長彈性杆在彎折、扭轉、拉伸和接觸中的力學行為,保證線纜形態符合物理規律;Isaac Sim 則以高質量光柵化和光線追蹤生成多樣化的場景光照與材質外觀。通過二者的耦合,WireSeg-32k 中的線纜不僅形態上接近真實,而且其接觸點、懸掛弧度和遮擋關係都與物理模擬結果一致,為模型提供了可學習的、自洽的幾何線索。此外,管線採用基於 CAD 的線纜資產,並注入不同的背景、相機視角和照明條件,使得訓練數據在保持真實性的同時兼顧視覺多樣性。
論文用一組基線實驗驗證了數據的實用價值。作者直接使用 WireSeg-32k 對 SAM3 進行 LoRA 微調,沒有引入複雜的域適應網絡或額外的訓練技巧。結果是,微調後的 SAM3 在真實世界測試集上的 mAP@75 比未經過微調的原始模型高出 10.2%。這個提升説明了兩個問題:一是合成數據確實能夠橋接 sim-to-real 差距,二是物理一致性比單純的圖像逼真更有助於模型理解線纜的結構。假如只是把線纜渲染得好看而忽略真實變形規律,模型很難在真實彎曲和接觸情況下保持同樣好的分割效果。
這篇論文於 2026 年 9 月 2 日提交至 arXiv(編號 2609.03102),投稿者為 Xiang Fei,作者信息顯示為 Zilin Dai 與另外三人。論文帶有“Synthetic Data for Computer Vision @ CVPR 2026 Workshop”的評論標記,説明已被該 CVPR 研討會接收,研究分類為計算機視覺與模式識別(cs.CV)。目前 arXiv 頁面提供了 PDF、HTML(實驗性)以及 TeX 源文件,讀者可以按需獲取更多的實現細節、可視化結果和後續更新。