LENS:LLM引导的复杂环境简化方法用于规划与控制
尽管通用机器人操作取得进展,现实世界中多物体杂乱环境仍具挑战。LENS作为一种即插即用的解决方案,利用大语言模型自动生成场景特定的简化抽象表示,通过合并或修剪实体来适应任务进展,从而提升各种操作方法的性能。
尽管近年来通用机器人操作取得了显著进步,但现实世界中的多物体杂乱环境仍然对当前主流方法构成巨大挑战。随着物体数量增多、碰撞频繁、接触物理难以预测以及干扰物和任务歧义性的存在,问题的复杂性呈指数级增长。现有的机器人操作方法,无论是基于经典规划、模型预测控制还是端到端的视觉-语言-动作模型,在面对高度杂乱场景时往往表现不佳。要缩小与现实世界部署之间的差距,需要有效的场景抽象表示来降低问题的维度。然而,目前生成这些抽象表示需要大量针对特定任务的手动工程,这不仅成本高昂,而且难以扩展和调整。例如,工程师需要手动定义哪些物体是相关的,如何合并堆叠的物体或忽略远处的干扰物,这一过程无法适应新任务或动态变化。
针对这一难题,研究人员提出了LLM引导的环境简化方法(LENS)。这是一种即插即用的解决方案,能够在现有规划与控制堆栈之上自动生成场景特定、任务特定且自适应更新的抽象表示。LENS通过闭环方式,根据任务进展动态地合并(例如,堆叠的物体)或修剪(例如,远处的物体)场景实体,从而产生去杂乱后的简化场景表示。这种方法利用大语言模型的理解能力,结合任务上下文和场景几何信息,实时决定哪些实体可以融合或忽略。生成的抽象表示具有动态性和任务相关性,且易于集成到各种机器人系统中。
在实验中,LENS被应用于多种高度杂乱的操作场景,包括经典规划(如基于采样的运动规划)、基于模型的控制(如模型预测控制)以及视觉-语言-动作模型(如RT-2)。结果表明,LENS显著提升了这些方法的成功率和效率。例如,在需要从一堆物体中抓取特定物品的任务中,LENS通过合并堆叠的物体降低了搜索空间,使经典规划的速度提升了数倍。同时,对于视觉-语言-动作模型,LENS提供的简化表示减少了模型的推理噪声,提高了任务完成的准确性。该方法的有效性证明了利用大语言模型进行场景简化的巨大潜力,为机器人操作在复杂环境中的实际部署提供了可行的路径。项目网站提供了更多详细信息:https://lens-2026.github.io/。