AI News HubLIVE
站內改寫2 分鐘閱讀

LENS:LLM引導的複雜環境簡化方法用於規劃與控制

儘管通用機器人操作取得進展,現實世界中多物體雜亂環境仍具挑戰。LENS作為一種即插即用的解決方案,利用大語言模型自動生成場景特定的簡化抽象表示,透過合併或修剪實體來適應任務進展,從而提升各種操作方法的效能。

來源arXiv Robotics作者: Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

儘管近年來通用機器人操作取得了顯著進步,但現實世界中的多物體雜亂環境仍然對當前主流方法構成巨大挑戰。隨著物體數量增多、碰撞頻繁、接觸物理難以預測以及干擾物和任務歧義性的存在,問題的複雜性呈指數級增長。現有的機器人操作方法,無論是基於經典規劃、模型預測控制還是端到端的視覺-語言-動作模型,在面對高度雜亂場景時往往表現不佳。要縮小與現實世界部署之間的差距,需要有效的場景抽象表示來降低問題的維度。然而,目前生成這些抽象表示需要大量針對特定任務的手動工程,這不僅成本高昂,而且難以擴充套件和調整。例如,工程師需要手動定義哪些物體是相關的,如何合併堆疊的物體或忽略遠處的干擾物,這一過程無法適應新任務或動態變化。

針對這一難題,研究人員提出了LLM引導的環境簡化方法(LENS)。這是一種即插即用的解決方案,能夠在現有規劃與控制堆疊之上自動生成場景特定、任務特定且自適應更新的抽象表示。LENS透過閉環方式,根據任務進展動態地合併(例如,堆疊的物體)或修剪(例如,遠處的物體)場景實體,從而產生去雜亂後的簡化場景表示。這種方法利用大語言模型的理解能力,結合任務上下文和場景幾何資訊,即時決定哪些實體可以融合或忽略。生成的抽象表示具有動態性和任務相關性,且易於整合到各種機器人系統中。

在實驗中,LENS被應用於多種高度雜亂的操作場景,包括經典規劃(如基於取樣的運動規劃)、基於模型的控制(如模型預測控制)以及視覺-語言-動作模型(如RT-2)。結果表明,LENS顯著提升了這些方法的成功率和效率。例如,在需要從一堆物體中抓取特定物品的任務中,LENS透過合併堆疊的物體降低了搜尋空間,使經典規劃的速度提升了數倍。同時,對於視覺-語言-動作模型,LENS提供的簡化表示減少了模型的推理噪聲,提高了任務完成的準確性。該方法的有效性證明了利用大語言模型進行場景簡化的巨大潛力,為機器人操作在複雜環境中的實際部署提供了可行的路徑。專案網站提供了更多詳細資訊:https://lens-2026.github.io/。