HarnessEval-W: 智能体化视觉世界的评估

Hugging Face Daily Papers 论文

摘要

HarnessEval-W 引入了一种针对世界模型的智能体化评估管道,使用层级化的子智能体将评估分解为透明的推理链,并在18个模型上进行基准测试,以与人类偏好对齐。

一个基准测试应该提供的不仅仅是一个标量分数:使评估可信的是证明分数合理的推理。这对于世界模型尤其关键,因为判断一次推演需要理解物理、因果关系和世界状态是否正确演变。人类能够自然地发现这类违规行为,但现有基准测试都没有自动化这一能力:指标是通过暴力计算得出的,没有留下可以检查或验证的推理链。我们引入了 HarnessEval-W,一种智能体化的评估管道,将 LLM 生态系统中的 harness 范式引入到世界模型基准测试中。HarnessEval-W 不是应用固定的标准,而是解释每个评估案例的上下文,将评估问题分解为可测量的子问题,并生成专门的子智能体,每个子智能体都配备定制的上下文和诊断工具来推理自己的子问题。然后,父智能体验证收集到的证据,并将其总结为最终结论。这种层级化的工作流程将每次评估转化为一个透明的证据树,其完整的推理链证明了结果的合理性。我们将 HarnessEval-W 应用于18个代表性的世界模型,涉及330个评估案例。其判断与人类偏好紧密对齐,同时为每次生成的推演提供可验证、细粒度的诊断。我们将整个管道开源为一个实时基准测试,并邀请广泛的社区贡献,随着世界模型的发展,增长新的技能和评估案例。
查看原文
查看缓存全文

缓存时间: 2026/08/18 07:53

论文页面 - HarnessEval-W:可视化世界的代理化评估

来源:https://huggingface.co/papers/2608.16859 发布于8月17日

#2 每日论文精选 (https://huggingface.co/papers/date/2026-08-18) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

HarnessEval-W 使用层级子代理将世界模型评估分解为可验证的推理链,以透明的证据来证明评分依据。

基准测试的价值不应仅限于一个标量分数:评估的可信度取决于能够证明该分数的推理过程。这对于世界模型尤为关键,因为对一次演化轨迹的评判需要理解物理规律、因果关系和世界状态是否正确演变。人类能自然地发现这类问题,但现有基准测试尚未自动化这种能力:现有评估方法大多通过暴力计算得出指标,无法生成可供审查或验证的推理链(https://huggingface.co/papers?q=reasoning%20chain)。我们提出了HarnessEval-W(https://huggingface.co/papers?q=HarnessEval-W),一个代理化评估流程(https://huggingface.co/papers?q=agentified%20evaluation%20pipeline),它将LLM生态系统中的harness范式(https://huggingface.co/papers?q=harness%20paradigm)引入世界模型基准测试(https://huggingface.co/papers?q=world%20model%20benchmarking)。HarnessEval-W(https://huggingface.co/papers?q=HarnessEval-W)并非应用固定标准,而是解读每个评估案例的上下文,将评估问题分解为可度量的子问题,并生成专门的子代理(https://huggingface.co/papers?q=sub-agents),每个子代理都配备定制化上下文和诊断工具来处理其对应的子问题。父代理随后验证收集到的证据,并将其总结为最终判断。这种层级化的工作流程将每次评估转化为一个透明的证据树(https://huggingface.co/papers?q=evidence%20tree),其完整的推理链(https://huggingface.co/papers?q=reasoning%20chain)为结果提供了依据。我们将HarnessEval-W(https://huggingface.co/papers?q=HarnessEval-W)应用于18个代表性世界模型,涵盖330个评估案例。其判断与人类偏好高度一致,同时为每一次生成的轨迹提供了可验证的细粒度诊断。我们将完整流程开源为一个实时基准测试,并邀请广大社区参与贡献,随着世界模型的发展共同扩展新的技能和评估案例。

查看arXiv页面 (https://arxiv.org/abs/2608.16859)查看PDF (https://arxiv.org/pdf/2608.16859)项目页面 (https://mirros-lab.github.io/HarnessEval-W)GitHub14 (https://github.com/MirroS-Lab/HarnessEval-W)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.16859)

在你的代理中获取此论文:

hf papers read 2608\.16859

还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型关联此论文

在模型README.md中引用arxiv.org/abs/2608.16859以从本页面关联。

引用此论文的数据集0

无数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2608.16859以从本页面关联。

引用此论文的Space0

无Space关联此论文

在Space README.md中引用arxiv.org/abs/2608.16859以从本页面关联。

包含此论文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面关联。

相似文章

重新思考智能体工具框架进化的评估

Hugging Face Daily Papers

本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

世界模型应如何评估?一种以决策为中心的立场

arXiv cs.LG

本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。

Agent-World:面向演进式通用智能体的现实世界环境合成扩展

Hugging Face Daily Papers

# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/61cd4b833dd34ba1985e0753/BfHfrwotoMESpXZOHiIe4.png)](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua