STeP:基于信号时序逻辑的视觉语言模型动作生成精确规范
视觉-语言-动作模型虽有出色泛化能力,但常缺乏可解释性且难以遵循包含空间、时间和逻辑要求的精确自然语言指令。本文提出一种分层框架,利用信号时序逻辑作为连接高层语言理解与低层机器人执行的共享表示,通过VLM将指令分解为子任务并生成STL规范,进而通过模型预测控制或监控执行来确保约束满足,在真实桌面场景中验证了该方法能提升语言条件机器人规划的精度、可靠性和可解释性。
视觉-语言-动作(VLA)模型在机器人任务中展现出强大的泛化能力,但往往缺乏可解释性,尤其在处理包含空间、时间和逻辑约束的复杂自然语言指令时表现不佳。针对这一问题,来自多所机构的研究者提出了STeP框架,该框架创新性地将信号时序逻辑(STL)作为连接高层语言理解与低层机器人执行的共享表示,从而实现了更精确、更可靠的机器人动作生成。
STeP框架的核心是一个分层架构。高层策略借助视觉语言模型(VLM)将用户的自然语言指令分解为若干高层子任务,并为每个子任务生成相应的STL规范。STL是一种形式化语言,能够精确描述时序和逻辑约束,如“在10秒内到达目标点”或“先抓取物体A再将其放置于B上”。这些规范将语言中的意图转化为机器人可执行的形式化约束。随后,高层策略会根据子任务的特点选择合适的低层策略。
低层策略有两种执行模式:对于约束明确且需要精确控制的子任务,采用STL引导的模型预测控制(MPC)直接强制执行约束;对于感知复杂或需要接触交互的行为,则采用学习得到的策略,此时STL规范用于在运行时监控执行过程,确保不违反关键约束。这种灵活的设计使得STeP能够适应不同性质的子任务。
STL的引入贯穿整个规划与执行流程。在计划验证阶段,STL规范可用于检查生成的子任务序列是否满足整体指令的约束;在执行过程中,系统持续对实际轨迹进行STL监控,一旦检测到偏离规范,立即触发重新规划。这一闭环机制确保了语言衍生计划能够在运行时被动态检查、优化和修正。
研究者在真实的桌面操作环境中对STeP进行了评估。实验涉及物体的拾取、放置、堆叠等典型任务,指令中包含了空间关系(如“左边”)、时序顺序(如“先…然后…”)和逻辑条件(如“如果…则…”)。结果表明,与传统方法相比,STeP显著提高了任务的成功率、执行的精确度以及对复杂指令的遵循能力。同时,STL提供的可解释性使得研究者能够清晰地理解机器人行为背后的逻辑。
该工作表明,形式化规范在语言条件机器人规划中具有重要价值。未来,STeP框架有望扩展到更复杂的环境和任务,并与其他形式化方法结合,进一步提升机器人系统的可靠性和透明度。相关论文已被提交至arXiv,代码和数据也将逐步公开。