VeriHarness:扩展长时程任务的智能体验证能力
摘要
VeriHarness 将 LLM 生成器转变为智能体式验证器——为其配备工作区、证据工具、可复用的验证技能、分歧消解器和共识挑战器——从而在没有参考答案的情况下,为长时程任务筛选可靠输出。在五个基准测试中,它取得了最高的选择得分,使用 Gemini 3.5 Flash 和 Claude Opus 4.8 分别比单次采样提升 6.2 至 6.4 个点,并发布了约 26,000 次采样结果,成本超过 100,000 美元。
查看缓存全文
缓存时间: 2026/10/05 08:46
论文页面 - VeriHarness:为长时程任务扩展智能体验证
来源:https://huggingface.co/papers/2610.00972
摘要
随着 LLM 智能体承担的任务日益复杂且时程越来越长,验证其输出结果也变得越来越困难。我们研究了如何在固定的基座模型上、且在测试时无法获得参考答案或评分标准的前提下,增强模型的验证能力。重复采样会产生多次采样轨迹(rollout),其中可能包含相互补充的正确论断,但我们需要一套可靠的验证机制来判定哪些论断值得信任。我们首先发现:分歧往往会暴露正确的替代方案,而共识则可能掩盖错误。基于这些观察,我们提出了 VeriHarness,它让底层 LLM 生成器转变为一个智能体验证器——为其提供工作区、证据工具以及可复用的验证技能。一个分歧消解器(disagreement resolver)会对照环境证据核查相互冲突的论断,而一个共识挑战器(consensus challenge)则对共享论断发起质疑,并寻找被遗漏的需求。它们的发现将指导最终产物的筛选与修改。
在五个长时程工作区基准测试和两个前沿模型上,VeriHarness 在所评估的基线方法中取得了最高的选择分数。基于证据的进一步修改还提升了平均性能,相对单次采样的增益在 Gemini 3.5 Flash 上达到 6.2 分,在 Claude Opus 4.8 上达到 6.4 分。我们进一步证明,验证技能可以从失败反馈中自我改进,这表明 VeriHarness 是一种新颖且关键的方法,可用于扩展长时程智能体验证。我们发布了涵盖所有五个基准、两个模型的约 26,000 次采样轨迹完整数据集,制作成本超过 100,000 美元,以支持未来关于智能体验证的研究。
查看 arXiv 页面(https://arxiv.org/abs/2610.00972)查看 PDF(https://arxiv.org/pdf/2610.00972)项目页面(https://veriharness.com/)GitHub(https://github.com/google-research/veriharness)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2610.00972)
在你的智能体中获取这篇论文:
hf papers read 2610.00972
还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型:0
尚无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2610.00972,即可从此页面链接。
引用本文的数据集:0
尚无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2610.00972,即可从此页面链接。
引用本文的 Space:0
尚无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2610.00972,即可从此页面链接。
收录本文的合集:0
尚无合集收录本文
将本文添加到合集(https://huggingface.co/new-collection),即可从此页面链接。
相似文章
AgentV-RL:用智能体验证器扩展奖励建模
AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。
Building an Advanced Agentic Harness
A technical blog post that walks through building a production-grade agentic harness around a basic LLM loop, covering typed tools, plan DAGs, tiered memory, verification hierarchies, budgets, and tracing.
最好的智能代理工具会这样做……
作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。
程序验证的智能体证明
本文在Clever基准的程序验证任务中,采用智能体证明框架评估Claude Code,在规范生成和端到端验证方面取得了超过98%的成功率,揭示出现有基准可能不足以评估现代智能体证明器的能力。
VeriTrace:类人时间探索完善智能体行动空间
VeriTrace 是一个用于自动化 Verilog RTL 生成的多智能体系统,它引入了智能体时间探索(Agentic Temporal Exploration),使调试智能体能够完全控制信号选择、时间窗口和迭代深度,在 VerilogEval-V2 上实现了 100% 的 Pass@1,并比基线模型高出 +5.1% 的性能。