从演示到奖励:VLM奖励模型的测试时提示优化

arXiv cs.LG 论文

摘要

提出Demo2Reward,一种针对VLM奖励模型的测试时提示优化技术,利用少量专家演示,显著减少误报,并在无需额外模型训练的情况下改进机器人策略学习。

arXiv:2606.00083v1 公告类型:新 摘要:强化学习依赖于准确的奖励函数,而在机器人等现实应用中,这些函数往往是手工设计的,甚至不可用。最近的研究探索了预训练视觉语言模型(VLM)的零样本推理能力作为奖励模型。然而,如果没有仔细的提示工程,这些方法往往会生成次优的奖励,其中误报预测会严重损害下游策略学习。在机器人领域,通常收集包含专家演示的有限数据集来启动策略学习。这种场景提供了在策略训练之前优化奖励模型的机会。我们提出Demo2Reward,一种测试时自适应技术,基于少量演示(3-10条轨迹)优化奖励模型的语言指令,以减少误报同时保留真阳性。关键在于,这在策略学习过程中不需要额外的模型训练或计算资源。我们展示了Demo2Reward在一系列模拟机器人任务和策略主干上始终优于现有的零样本和少样本VLM奖励模型。最后,我们证明Demo2Reward能有效迁移到真实世界的机器人学习场景,无需手动设计奖励函数即可进行策略学习。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:39

# 从演示到奖励:VLM奖励模型的测试时提示优化
来源:https://arxiv.org/abs/2606.00083
查看 PDF (https://arxiv.org/pdf/2606.00083)

> 摘要:强化学习依赖于准确的奖励函数,而在机器人等实际应用中,这些函数往往需要手动设计甚至无法获得。近期研究探索了预训练视觉语言模型(VLM)的零样本推理能力,将其用作奖励模型。然而,若缺乏细致的提示工程,这些方法容易产生次优奖励,其中假阳性预测会严重破坏后续的策略学习。在机器人领域,通常收集少量包含专家演示的数据集来引导策略学习。这种场景为我们提供了在策略训练之前优化奖励模型的机会。我们提出 Demo2Reward——一种测试时自适应技术,可基于少量演示(3-10 条轨迹)优化奖励模型的语言指令,在保留真阳性预测的同时减少假阳性。关键在于,该方法在策略学习过程中无需额外的模型训练或计算资源。我们证明,在一系列模拟机器人任务和策略主干中,Demo2Reward 的表现始终优于现有的零样本和少样本 VLM 奖励模型。最后,我们展示了 Demo2Reward 能够有效迁移至真实世界的机器人学习场景,无需人工设计奖励函数即可实现策略学习。

## 提交历史

来自:Christian Gumbsch [查看邮件 (https://arxiv.org/show-email/d24a5fb9/2606.00083)] **\[v1\]**2026年5月22日,星期五,16:04:22 UTC(2,393 KB)

相似文章

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。

向量策略优化:面向多样性的训练提升测试时搜索性能

Reddit r/LocalLLaMA

本文介绍了一种名为向量策略优化(Vector Policy Optimization, VPO)的强化学习算法,该算法通过优化多个奖励维度来训练大语言模型生成多样化的解决方案,与标量强化学习基线相比,显著提升了测试时搜索性能。