一項名為 FailureSpot 的新研究提出了一種標籤高效的視覺-語言-動作(VLA)模型故障檢測方法,旨在解決機器人長時程操作中故障預測的時間戳級定位難題。該論文由 Jie Ma 等三位作者撰寫,於2026年9月3日提交至 arXiv,編號為 2609.04277,歸屬機器人學(cs.RO)和計算機視覺(cs.CV)領域。
VLA 策略在通用機器人操作中展現出強大潛力,但在長時間執行過程中仍可能不可預測地失敗。為了安全部署,可靠的故障檢測至關重要。現有方法通常依賴視覺模型,這類模型往往只能在錯誤動作已經發生之後才檢測到故障;另一種思路是使用基於 VLA 內部表徵訓練的輕量級主動檢測器。然而,這些主動檢測方法通常使用軌跡級標籤進行監督,導致在不成功軌跡中,故障發生前的正常行為也會被錯誤地標記為故障。這種監督不匹配引入了標籤噪聲,既限制了軌跡級檢測的準確性,也妨礙了精確到時間戳的故障定位。
為此,研究團隊聚焦於細粒度的時間戳級 VLA 故障檢測,同時應對密集標註成本過高的問題。他們提出了一種資料高效的框架,首先利用無標註的 VLA 動作塊構建基於動作的弱監督訊號,捕捉多種異常模式,例如連續動作塊不一致、動作凍結或停滯、以及激進的隨機運動。然後,透過主動學習僅篩選出最不確定的軌跡進行時間戳級標註,並利用這些資訊量豐富的標籤對檢測器進行微調。
實驗在多種 VLA 策略上開展,結果表明該方法同時提升了時間戳級和軌跡級的故障檢測效能。這一工作為機器人安全操作提供了更具實用性的故障預警手段,有望在真實世界部署中減少因動作異常導致的意外後果。FailureSpot 的程式碼和資料關聯資訊可在 arXiv 論文頁面獲取,論文還提供了 PDF 和實驗性 HTML 版本供讀者查閱。