OSReward:为跨平台计算机使用奖励模型建立标准化评估

Hugging Face Daily Papers 论文

摘要

OSReward 提出了一个标准化基准,用于评估 VLM 在计算机使用智能体轨迹上的评判能力,揭示了即使是最先进的模型也存在系统性的宽大偏差。作者发布了 OS-Shepherd-9B 和 35B 奖励模型,为 CUA 任务提供可靠且低成本的奖励信号。

计算机使用智能体(CUA)正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是 CUA 评估、数据构建和强化学习的核心。人工编写的验证器或人工标注者都无法大规模提供这种验证,因此该领域越来越多地转向视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个基本问题长期以来未得到审视:这些 VLM 评判者是否足够可靠?为了系统研究这一问题,我们提出了 OSReward,一个真实、高质量的基准,用于在 CUA 轨迹上评估 VLM 评判者。这些轨迹来自多种智能体骨干在跨平台上执行经人工验证的指令,并通过多阶段人工标注严格标记了真实结果。在此基础上,我们构建了 OSReward-Hard,一个聚焦真正困难案例的挑战集,以及用于细粒度效率和一致性评分的 OSReward-Multi。迄今为止对 VLM 评判者最全面的评估发现,即使是最先进的模型也达不到理想评判者的水平,并且普遍存在系统性的宽大偏差,将失败运行错误标记为成功。少数足够可靠、值得信赖的模型在大规模运行上过于昂贵,而价格实惠的开源模型则远远落后。为了弥合这一差距,我们构建并发布了 OS-Shepherd-100K,一个面向 CUA 社区、带有推理标注的轨迹判断开源语料库。在此基础上,我们训练了 OS-Shepherd(9B 和 35B)开源奖励模型,提供低成本、稳定且可靠的奖励信号,在比前沿模型低 30-60% 的成本下达到商用评判者的水平。广泛的分析进一步为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:55

论文页面 - OSReward:为跨平台计算机使用奖励模型建立标准化评估

Source: https://huggingface.co/papers/2607.28609 发布于 7 月 30 日

· 提交者 https://huggingface.co/QiushiSun

Qiushi (https://huggingface.co/QiushiSun)于 8 月 7 日

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

计算机使用智能体(CUA)正在数字世界中快速发展。CUA 轨迹记录了智能体的动作、状态和推理。验证其是否完成了任务指令,是 CUA 评估、数据整理和强化学习的核心。人工编写的验证器和人工标注者都无法大规模提供此类验证,因此该领域越来越依赖视觉语言模型(VLM)作为 CUA 轨迹的评判者。但一个根本性问题长期未被审视:这些 VLM 评判者足够可靠吗?为了系统地研究这个问题,我们提出了 OSReward,一个真实、高质量的基准,用于在 CUA 轨迹上评估 VLM 评判者。这些轨迹来自多种智能体后端执行的跨平台人工验证指令,并通过多阶段人工标注严格标注了真值判定。在此基础上,我们构建了 OSReward-Hard(专注于真正困难案例的挑战集)和 OSReward-Multi(用于细粒度效率和一致性评分)。迄今为止最全面的 VLM 评判者评估发现,即使是最先进的模型也达不到理想评判者的水平,它们普遍存在一种系统性宽松偏差,会将失败的运行误判为成功。少数足够可靠、值得信赖的模型又因成本过高而无法大规模运行,而价格可承受的开源模型则远远落后。为了弥合这一差距,我们构建并发布了 OS-Shepherd-100K,这是一个面向 CUA 社区的、带有推理标注的轨迹判断开放语料库。在此基础上,我们训练了 OS-Shepherd(9B 和 35B)开放奖励模型,以低成本、稳定且可靠的方式提供奖励信号,在比前沿模型低 30-60% 的成本下达到商业评判者的水平。广泛的分析还为大规模可靠 CUA 奖励的设计提供了参考。我们的代码、基准、数据集和模型检查点可在 https://os-copilot.github.io/OSReward-Home/ 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28609)查看 PDF (https://arxiv.org/pdf/2607.28609)项目页面 (https://os-copilot.github.io/OSReward-Home/)GitHub (https://github.com/OS-Copilot/OSReward)添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2607.28609)

在您的智能体中获取此论文:

hf papers read 2607\.28609

还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 2

OS-Copilot/OS-Shepherd-9B Image-Text-to-Text• 9B• 更新于 2 天前 • 11 (https://huggingface.co/OS-Copilot/OS-Shepherd-9B)

OS-Copilot/OS-Shepherd-35B-A3B Image-Text-to-Text• 35B• 更新于 2 天前 (https://huggingface.co/OS-Copilot/OS-Shepherd-35B-A3B)

引用此论文的数据集 1

OS-Copilot/OSreward-bench Viewer• 更新于约 1 小时前 • 1.3k • 1 (https://huggingface.co/datasets/OS-Copilot/OSreward-bench)

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.28609,即可从本页链接到它。

包含此论文的集合 0

没有包含此论文的集合

将此论文添加到集合(https://huggingface.co/new-collection)中,即可从本页链接到它。

相似文章

结合自主评估的计算机操作代理强化学习

arXiv cs.AI

本文提出了一种面向计算机操作代理的强化学习框架,该框架利用自主视觉-语言评估作为可扩展的奖励信号,并对评估者噪声进行建模,以提高桌面环境中的任务成功率。

科学写作评估的奖励建模

arXiv cs.CL

本文提出 SciRM,一种经济高效的开源奖励模型,通过两阶段训练框架专门用于评估科学写作,该框架优化了评估偏好和推理能力。这些模型可以泛化到多种科学写作任务,无需任务特定的重新训练,解决了现有基于 LLM 的评判器在特定领域评估标准上的局限性。

PRO-CUA:面向计算机使用代理的过程奖励优化

arXiv cs.AI

本文介绍了PRO-CUA,一种使用迭代步骤级强化学习训练计算机使用代理(CUA)的过程奖励优化框架。该方法将同策略环境交互与策略优化解耦,实现了密集的信用分配,无需依赖专家轨迹,并在实时网络基准测试中展示了有效性。

Skill-RM: 通过智能体技能统一异构评估标准

Hugging Face Daily Papers

Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。