本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

FailureSpot:視覚-言語-行動モデルのためのラベル効率的なタイムスタンプレベル障害検出

記事の要約

視覚-言語-行動(VLA)ポリシーは長期的な実行中に予測不能な失敗を起こす可能性があり、既存の検出手法は軌跡レベルのラベルノイズに悩まされています。FailureSpotは、ラベルなしのアクションチャンクから弱教師信号を構築し、アクティブラーニングで最も不確実な軌跡を選んでタイムスタンプレベルで注釈付けすることで、複数のVLAポリシーにおいて障害検出性能を向上させます。

ソースarXiv Robotics著者: Jie Ma, Zongxi Liu, Yi Zhu
FailureSpot:視覚-言語-行動モデルのためのラベル効率的なタイムスタンプレベル障害検出
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

視覚-言語-行動(VLA)モデルは汎用ロボット操作において大きな可能性を示していますが、長期的なタスク実行中には予測不能な失敗が発生し得るため、安全な展開には信頼性の高い障害検出が不可欠です。既存手法は、誤った動作が発生した後にしか失敗を検出できない視覚モデルに依存するか、VLAの内部表現を用いて訓練された軽量な先行検出器を利用するかのどちらかです。しかし後者の手法は軌跡レベルのラベルで教師されることが多く、その結果、失敗した軌跡における正常な失敗前行動が誤って「失敗」とラベル付けされます。このような監督の不一致はラベルノイズを引き起こし、軌跡レベルの検出精度とタイムスタンプレベルの正確な位置特定の両方を制限します。

本研究では、密な注釈のコストに対処しながら、きめ細かいタイムスタンプレベルのVLA障害検出を検討します。提案手法であるFailureSpotは、まずラベルなしのVLAアクションチャンクを活用して、アクション由来の弱教師信号を構築します。これにより、連続するチャンクの不整合、動作の凍結やアイドル状態、激しくランダムな動きといった異常パターンを捉えることができます。この弱教師信号は人手による注釈なしで得られるため、障害検出のための豊富で初期段階の監視情報となります。

次にFailureSpotはアクティブラーニングを導入し、モデルが最も不確実と判断した軌跡だけを選択して、タイムスタンプレベルの注釈を付けます。これにより、密集した注釈付けに伴う高コストを回避しつつ、情報量の多いラベルで検出器を微調整し、失敗の発生時刻を正確に特定できるようにします。複数のVLAポリシーを用いた実験では、この手法がタイムスタンプレベルと軌跡レベルの両方で障害検出性能を改善することが示されました。

本論文はJie Ma氏らによって執筆され、2026年9月3日にarXivへ投稿されました。ロボティクスとコンピュータビジョンの分野に分類されるこの研究は、弱教師信号とアクティブラーニングを組み合わせることで、VLAモデルの実運用における安全性向上に貢献する可能性があります。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • 既存の視覚ベース検出は誤動作後にしか反応できず、VLA内部表現を使う先行検出手法は軌跡レベルのラベルによる誤った監督を受けやすい。
  • FailureSpotはアクションチャンクの不整合、停止・アイドル動作、過剰なランダム動作などの異常パターンを弱教師信号として捉える。
  • アクティブラーニングにより不確実な軌跡だけを選んでタイムスタンプレベルで注釈し、ラベルコストを抑えつつ検出精度を高める。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。