HarnessEval-W: 智能体化视觉世界的评估
摘要
HarnessEval-W 引入了一种针对世界模型的智能体化评估管道,使用层级化的子智能体将评估分解为透明的推理链,并在18个模型上进行基准测试,以与人类偏好对齐。
查看缓存全文
缓存时间: 2026/08/18 07:53
论文页面 - HarnessEval-W:可视化世界的代理化评估
来源:https://huggingface.co/papers/2608.16859 发布于8月17日
#2 每日论文精选 (https://huggingface.co/papers/date/2026-08-18) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
HarnessEval-W 使用层级子代理将世界模型评估分解为可验证的推理链,以透明的证据来证明评分依据。
基准测试的价值不应仅限于一个标量分数:评估的可信度取决于能够证明该分数的推理过程。这对于世界模型尤为关键,因为对一次演化轨迹的评判需要理解物理规律、因果关系和世界状态是否正确演变。人类能自然地发现这类问题,但现有基准测试尚未自动化这种能力:现有评估方法大多通过暴力计算得出指标,无法生成可供审查或验证的推理链(https://huggingface.co/papers?q=reasoning%20chain)。我们提出了HarnessEval-W(https://huggingface.co/papers?q=HarnessEval-W),一个代理化评估流程(https://huggingface.co/papers?q=agentified%20evaluation%20pipeline),它将LLM生态系统中的harness范式(https://huggingface.co/papers?q=harness%20paradigm)引入世界模型基准测试(https://huggingface.co/papers?q=world%20model%20benchmarking)。HarnessEval-W(https://huggingface.co/papers?q=HarnessEval-W)并非应用固定标准,而是解读每个评估案例的上下文,将评估问题分解为可度量的子问题,并生成专门的子代理(https://huggingface.co/papers?q=sub-agents),每个子代理都配备定制化上下文和诊断工具来处理其对应的子问题。父代理随后验证收集到的证据,并将其总结为最终判断。这种层级化的工作流程将每次评估转化为一个透明的证据树(https://huggingface.co/papers?q=evidence%20tree),其完整的推理链(https://huggingface.co/papers?q=reasoning%20chain)为结果提供了依据。我们将HarnessEval-W(https://huggingface.co/papers?q=HarnessEval-W)应用于18个代表性世界模型,涵盖330个评估案例。其判断与人类偏好高度一致,同时为每一次生成的轨迹提供了可验证的细粒度诊断。我们将完整流程开源为一个实时基准测试,并邀请广大社区参与贡献,随着世界模型的发展共同扩展新的技能和评估案例。
查看arXiv页面 (https://arxiv.org/abs/2608.16859)查看PDF (https://arxiv.org/pdf/2608.16859)项目页面 (https://mirros-lab.github.io/HarnessEval-W)GitHub14 (https://github.com/MirroS-Lab/HarnessEval-W)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.16859)
在你的代理中获取此论文:
hf papers read 2608\.16859
还没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型关联此论文
在模型README.md中引用arxiv.org/abs/2608.16859以从本页面关联。
引用此论文的数据集0
无数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2608.16859以从本页面关联。
引用此论文的Space0
无Space关联此论文
在Space README.md中引用arxiv.org/abs/2608.16859以从本页面关联。
包含此论文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面关联。
相似文章
重新思考智能体工具框架进化的评估
本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
世界模型应如何评估?一种以决策为中心的立场
本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua