PRM-as-a-Judge 1.5: 机器人流程评估工具包

Hugging Face Daily Papers 论文

摘要

PRM-as-a-Judge 1.5 是一款工具包,提供细粒度指标和可靠性工具,用于评估具身机器人模型,超越二元成功率,专注于过程进展和执行质量的评估。

细粒度机器人评估对于理解具身模型至关重要,它超越了二元成功率和基于规则的过程评分。我们推出 PRM-as-a-Judge 1.5,这是一个机器人流程评估工具包,它将执行视频转化为密集进展曲线,并推导出多个细粒度指标。PRM-as-a-Judge 1.5 引入了三个指标,基于版本 1.0,分别刻画失败侧进展、回撤后恢复和成功侧执行质量,帮助用户理解具身模型的能力。基于基准测试的执行视频,我们对具身模型进行了全面评估,提供了一些细粒度指标结果和关键发现。我们进一步推出 RoboPulse++ 来评估过程奖励模型 (PRM) 的可靠性,为评估者提供一个更准确的测试平台。此外,我们发布了一个用户友好的评估套件,包括基准测试、指标实现和可视化工具,以支持可复现的操作过程评估。我们呼吁社区重新思考机器人评估方式,并建立透明、程序化和可复现的评估,作为下一代具身智能的基础。
查看原文
查看缓存全文

缓存时间: 2026/08/17 07:45

论文页面 - PRM-as-a-Judge 1.5:机器人过程评估工具包

来源:https://huggingface.co/papers/2608.14284 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

PRM-as-a-Judge 1.5 提供了细粒度的过程指标与可靠性工具,用于超越二元成功率对具身机器人模型进行评估。

细粒度的机器人评估对于理解具身模型至关重要(https://huggingface.co/papers?q=embodied%20models),能够超越二元成功率和基于规则的过程评分。我们推出了 PRM-as-a-Judge 1.5,这是一个机器人过程评估工具包,它能将过程执行视频(https://huggingface.co/papers?q=rollout%20videos)转化为密集的进度曲线(https://huggingface.co/papers?q=progress%20curves),并据此推导出多种细粒度指标。PRM-as-a-Judge 1.5 在 1.0 版本的基础上引入了三个新指标,分别表征失败侧进展(https://huggingface.co/papers?q=failure-side%20progress)、回撤后恢复(https://huggingface.co/papers?q=post-drawdown%20recovery)和成功侧执行质量(https://huggingface.co/papers?q=execution%20quality),以帮助用户深入理解具身模型的能力。基于基准测试中的过程执行视频(https://huggingface.co/papers?q=rollout%20videos),我们对具身模型(https://huggingface.co/papers?q=embodied%20models)进行了全面评估,提供了一些细粒度指标结果和关键发现。我们进一步引入了 RoboPulse++(https://huggingface.co/papers?q=RoboPulse%2B%2B)来评估过程奖励模型(PRM)的可靠性,为评估者提供一个更准确的测试平台。此外,我们发布了一套用户友好的评估套件,包括基准测试、指标实现和可视化工具,以支持可复现的操作过程评估。我们呼吁社区重新思考机器人的评估方式,并建立透明、基于过程且可复现的评估体系,以此作为下一代具身智能的基础。

查看 arXiv 页面 (https://arxiv.org/abs/2608.14284)查看 PDF (https://arxiv.org/pdf/2608.14284)项目页面 (https://prm-as-a-judge.github.io/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.14284)

通过您的智能体获取此论文:

hf papers read 2608.14284

尚未安装最新的命令行工具?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2608.14284 以从本页面链接。

引用本文的数据集0

无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.14284 以从本页面链接。

引用本文的 Spaces0

无 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.14284 以从本页面链接。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

结合学习可靠性的过程奖励

arXiv cs.CL

BetaPRM 是一种过程奖励模型,它使用来自蒙特卡洛延续的 Beta 信念来预测步骤级的成功概率以及该预测的可靠性,从而实现自适应计算分配,在提高准确性的同时将 token 使用量减少高达 33.57%。

SCI-PRM:一种面向科学推理验证的工具感知过程奖励模型

arXiv cs.AI

# SCI-PRM:面向科学推理的工具感知过程奖励模型 SCI-PRM 提出了一种面向科学推理的工具感知过程奖励模型(Process Reward Model),基于 SCIPRM70K 数据集训练而成。该数据集包含"Chain-of-Tool"轨迹,将推理过程与科学工具的调用执行交织融合。SCI-PRM 能够实现高效的测试时扩展(test-time scaling),并作为强化学习中的密集奖励信号(dense reward signal),在科学基准测试的工具调用步骤上超越了 GPT-5-Mini 等专有模型。

PRISM:通过结构化多模态数据合成实现优先级感知的规则内化

arXiv cs.LG

本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。

仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估

Hugging Face Daily Papers

RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。