AI News HubLIVE
站內改寫1 分鐘閱讀

FLASH:基於稀疏取樣的高效視覺運動策略

研究人員提出FLASH策略,利用勒讓德多項式軌跡表示和稀疏時間取樣實現單步推理,在五個模擬和兩個真實世界的操作任務中達到92%以上的成功率,推理時間僅31.4毫秒,比擴散策略快175倍。

來源arXiv Robotics作者: Jiaqi Bai, Jindou Jia, Yuxuan Hu, Gen Li, Xiangyu Chen, Tuo An, Kuangji Zuo, Jianfei Yang

近年來,擴散模型和流匹配模型已成為視覺運動策略學習的主流正規化,但它們依賴迭代去噪過程,導致推理延遲較高,難以滿足機器人即時控制的需求。針對這一問題,研究人員提出了FLASH(Fast Legendre-polynomial Action policy via Sparse History-anchored flow)策略,旨在透過連續勒讓德多項式軌跡表示和稀疏時間取樣,實現高效的單步推理。

FLASH的核心創新在於用連續勒讓德多項式軌跡替代傳統的離散動作塊生成。透過稀疏時間取樣擬合專家演示,FLASH能夠在單次推理中覆蓋顯著延長的動作範圍。傳統的離散動作塊生成方法通常需要多個推理步驟來規劃一段連續動作,而FLASH透過連續多項式表示,使得單步推理即可輸出完整的軌跡,極大減少了計算開銷。

為了進一步加速生成過程,FLASH從歷史多項式係數而非無資訊的高斯噪聲初始化流匹配過程。這一設計縮短了傳輸距離,使模型能夠準確地進行單步推理。此外,解析多項式微分可直接向扭矩控制器提供所需的速度前饋訊號,無需數值近似,從而降低了控制延遲。

在實驗驗證方面,研究團隊在五個模擬環境(如杯子堆放、物體轉移等)和兩個真實世界的操作任務(如機械臂抓取和裝配)中進行了廣泛測試。結果顯示,FLASH在所有任務中均達到了92%以上的成功率,每個episode的推理時間僅為31.40毫秒——比擴散策略快175倍,比先前的流匹配策略快18倍。此外,FLASH的訓練收斂速度比ACT快4倍,控制器跟蹤誤差相比離散動作基線降低了5至7倍。

這些成果表明,FLASH在即時機器人控制方面具有巨大潛力,尤其適用於需要高頻更新的高動態任務。未來,研究人員計劃探索將FLASH擴充套件到更復雜的操作場景,並進一步最佳化其泛化能力。