OSReward:为跨平台计算机使用奖励模型建立标准化评估
摘要
OSReward 提出了一个标准化基准,用于评估 VLM 在计算机使用智能体轨迹上的评判能力,揭示了即使是最先进的模型也存在系统性的宽大偏差。作者发布了 OS-Shepherd-9B 和 35B 奖励模型,为 CUA 任务提供可靠且低成本的奖励信号。
查看缓存全文
缓存时间: 2026/08/07 05:55
论文页面 - OSReward:为跨平台计算机使用奖励模型建立标准化评估
Source: https://huggingface.co/papers/2607.28609 发布于 7 月 30 日
· 提交者 https://huggingface.co/QiushiSun
Qiushi (https://huggingface.co/QiushiSun)于 8 月 7 日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
计算机使用智能体(CUA)正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理。验证其是否完成了任务指令,是 CUA 评估、数据整理和强化学习的核心。人工编写的验证器和人工标注者都无法大规模提供此类验证,因此该领域越来越依赖视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个根本性问题长期未被审视:这些 VLM 评判者足够可靠吗?为了系统地研究这个问题,我们提出了 OSReward,一个真实、高质量的基准,用于在 CUA 轨迹上评估 VLM 评判者。这些轨迹来自多种智能体后端执行的跨平台人工验证指令,并通过多阶段人工标注严格标注了真值判定。在此基础上,我们构建了 OSReward-Hard(专注于真正困难案例的挑战集)和 OSReward-Multi(用于细粒度效率和一致性评分)。迄今为止最全面的 VLM 评判者评估发现,即使是最先进的模型也达不到理想评判者的水平,它们普遍存在一种系统性宽松偏差,会将失败的运行误判为成功。少数足够可靠、值得信赖的模型又因成本过高而无法大规模运行,而价格可承受的开源模型则远远落后。为了弥合这一差距,我们构建并发布了 OS-Shepherd-100K,这是一个面向 CUA 社区的、带有推理标注的轨迹判断开放语料库。在此基础上,我们训练了 OS-Shepherd(9B 和 35B)开放奖励模型,以低成本、稳定且可靠的方式提供奖励信号,在比前沿模型低 30-60% 的成本下达到商业评判者的水平。广泛的分析还为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28609)查看 PDF (https://arxiv.org/pdf/2607.28609)项目页面 (https://os-copilot.github.io/OSReward-Home/)GitHub (https://github.com/OS-Copilot/OSReward)添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2607.28609)
在您的智能体中获取此论文:
hf papers read 2607\.28609
还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 2
OS-Copilot/OS-Shepherd-9B Image-Text-to-Text• 9B• 更新于 2 天前 • 11 (https://huggingface.co/OS-Copilot/OS-Shepherd-9B)
OS-Copilot/OS-Shepherd-35B-A3B Image-Text-to-Text• 35B• 更新于 2 天前 (https://huggingface.co/OS-Copilot/OS-Shepherd-35B-A3B)
引用此论文的数据集 1
OS-Copilot/OSreward-bench Viewer• 更新于约 1 小时前 • 1.3k • 1 (https://huggingface.co/datasets/OS-Copilot/OSreward-bench)
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.28609,即可从本页链接到它。
包含此论文的集合 0
没有包含此论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)中,即可从本页链接到它。
相似文章
结合自主评估的计算机操作代理强化学习
本文提出了一种面向计算机操作代理的强化学习框架,该框架利用自主视觉-语言评估作为可扩展的奖励信号,并对评估者噪声进行建模,以提高桌面环境中的任务成功率。
科学写作评估的奖励建模
本文提出 SciRM,一种经济高效的开源奖励模型,通过两阶段训练框架专门用于评估科学写作,该框架优化了评估偏好和推理能力。这些模型可以泛化到多种科学写作任务,无需任务特定的重新训练,解决了现有基于 LLM 的评判器在特定领域评估标准上的局限性。
PRO-CUA:面向计算机使用代理的过程奖励优化
本文介绍了PRO-CUA,一种使用迭代步骤级强化学习训练计算机使用代理(CUA)的过程奖励优化框架。该方法将同策略环境交互与策略优化解耦,实现了密集的信用分配,无需依赖专家轨迹,并在实时网络基准测试中展示了有效性。
Skill-RM: 通过智能体技能统一异构评估标准
Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。
OSWorld2.0:长周期真实世界任务中计算机使用代理的基准评测
OSWorld 2.0 是一个新的基准测试,用于评估计算机使用代理在 108 个长周期真实工作流程上的表现。当前像 Claude Opus 4.8 和 GPT-5.5 这样的代理完成率较低,凸显了它们在处理复杂多步骤任务时的显著局限性。