跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

通過深度強化學習實現人類陪伴機器人的自適應交互策略

文章摘要

一篇已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收的論文,提出用深度強化學習讓移動機器人在陪伴行人時動態調整自身跟蹤位置,並融合模型預測路徑積分控制與控制障礙函數來兼顧精準跟隨、避障與安全。室內外真實場景實驗顯示,該方法將任務成功率與跟蹤精度分別至少提升 24% 與 47%,並能在行人速度最高 1.7 m/s 的情況下靈活伴行、提升人的舒適度。

來源arXiv Robotics作者: Cong-Thanh Vu, Yen-Chen Liu
通過深度強化學習實現人類陪伴機器人的自適應交互策略
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

在人類與機器人交互(HRI)研究中,機器人能否在真實環境裏靈活地陪伴人類行走,被認為是極具應用潛力的方向,但同時也是一大難題。既有做法通常把機器人綁定在相對人的某個固定方位上——例如始終跟在身後、走在身前或與人並排——這種設定在人員流動、障礙物變化的動態工作空間裏很快就顯得僵化,機器人的適應性因此受到明顯限制。

針對這一問題,這篇論文提出了一種新的人類伴行策略,核心是用深度強化學習(DRL)讓移動機器人依據不斷變化的環境條件,動態決定自己應當處於什麼跟蹤位置。研究定義了一個“交互空間”,用來刻畫人與機器人之間、並同時考慮周圍環境的關係;這一交互空間隨後成為 DRL 狀態空間的基礎,使機器人能夠感知並適應環境變化,而不是死守某一個預設方位。在控制層面,作者把模型預測路徑積分(MPPI)控制與控制障礙函數(CBF)結合起來,構建出人—機器人伴行控制器。該控制器一方面保證機器人在位置和朝向上都能準確跟隨目標人物的運動,另一方面兼顧障礙物規避,從而提升社會接受度與安全性。

評估工作在真實的室內與室外場景中完成,並與其它研究進行了對比。結果顯示,所提方法在任務成功率和跟蹤精度上分別至少提升了 24% 和 47%,同時也改善了人類夥伴的舒適感受。實驗還驗證了機器人的靈活伴行能力:當人以最高 1.7 m/s 的速度行走時,機器人能夠動態調整策略,而不再被限制在某個固定位置。此外,機器人會尊重人的親密空間,在保證安全與舒適的前提下完成有效的避障。

論文由 Cong-Thanh Vu 與 Yen-Chen Liu 完成,於 2026 年 8 月 20 日提交至 arXiv(編號 arXiv:2609.25031v1,主分類 cs.RO,交叉分類 eess.SY),數字對象標識符為 10.48550/arXiv.2609.25031。該工作已被 IEEE Transactions on Systems, Man, and Cybernetics: Systems 接收。需要注意的是,上述結果均來自論文摘要層面的陳述,具體算法實現、實驗設置與侷限仍需查閲原文全文。

展開要點與分析

文章情報

研究者進階

要點

  • 傳統伴行機器人被限制在人的後方、前方或並排等固定相對位置,難以適應動態工作空間。
  • 研究定義“交互空間”來刻畫人、機器人與環境三者關係,並將其作為深度強化學習狀態空間的基礎。
  • 控制器結合 MPPI 與控制障礙函數(CBF),在保證位置與朝向精確跟隨的同時實現避障與安全。
  • 真實室內外實驗中成功率與跟蹤精度分別至少提升 24% 和 47%,機器人可伴行最高 1.7 m/s 的行人。

技術影響

可能影響具身智能、機器人部署、傳感器集成和工業應用。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。