AI News HubLIVE
站内改写1 分钟阅读

从示范到奖励:VLM奖励模型的测试时提示优化

Demo2Reward是一种测试时适应技术,通过3-10条专家示范轨迹优化视觉语言模型(VLM)奖励模型的提示,减少误报的同时保持正确检测,无需额外训练或计算资源,在模拟和真实机器人任务中均优于现有方法。

来源arXiv Machine Learning作者: Christian Gumbsch, Leonardo Barcellona, Lennard Sch\"unemann, Platon Karageorgis, Andrii Zadaianchuk, Zehao Wang, Sergey Zakharov, Fabien Despinoy, Rahaf Aljundi, Efstratios Gavves

强化学习(RL)依赖于精确的奖励函数,但在机器人等实际应用中,奖励函数往往需要手工设计甚至难以获取。近年来,预训练视觉语言模型(VLM)的零样本推理能力被探索用于奖励模型,但若缺乏精心设计的提示,这些方法容易产生次优奖励,其中误报(false positives)会严重破坏下游策略学习。在机器人领域,通常收集少量专家示范数据(例如3-10条轨迹)来启动策略学习,这为在策略训练前优化奖励模型提供了机会。

为此,研究团队提出了Demo2Reward,一种测试时适应技术,通过少量示范优化奖励模型的语言指令,从而在保持正确检测的同时减少误报。关键在于,该方法在策略学习过程中无需额外的模型训练或计算资源。实验表明,Demo2Reward在多种模拟机器人任务和策略主干(如PPO、SAC)上持续优于现有的零样本和少样本VLM奖励模型,平均奖励准确率提升约15%。此外,该方法成功迁移到真实机器人学习场景,例如机械臂抓取任务,无需手动设计奖励函数即可实现策略学习。

论文作者包括Christian Gumbsch等十位研究人员,论文于2026年5月22日提交至arXiv(编号2606.00083),涉及机器学习、人工智能和机器人学领域。该工作为利用少量示范数据优化VLM奖励模型提供了一种高效、实用的解决方案,有望推动机器人学习在实际应用中的落地。