验证前沿:编码智能体奖励并无银弹

Hugging Face Daily Papers 论文

摘要

本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。

一个经典的直觉认为,验证解决方案比生成解决方案更容易。对于当今的编码智能体而言,这一直觉正在被颠覆:随着基础模型发展出更强的推理能力,工程框架变得更加复杂,生成复杂的候选解决方案已不再困难——而可靠地验证它们却成了更难的问题。我们构建的每一个验证器都只是人类意图的代理,而非意图本身。这使得验证面临双重困难:首先,意图本质上是未充分指定的,因此固有地难以忠实检查其是否被满足;其次,在模型训练过程中,优化会扩大代理与意图之间的差距——表现为奖励欺骗或信号饱和。为了解决这一问题,我们从三个维度——可扩展性、忠实性和鲁棒性——来刻画验证信号的质量,并认为同时实现这三者是核心挑战。我们进一步研究了四种奖励构建方式:通用编码任务的测试验证器、前端任务的评分标准验证器、现实世界智能体任务中以用户为验证器、以及长周期任务的自动化智能体验证器。针对不同的任务类型和策略能力水平,我们对奖励设计的核心挑战以及如何更有效地利用奖励信号进行了深入分析和实验。实验表明,有针对性的验证设计能有效抑制奖励欺骗,提高任务完成质量,并在多个内部和公共基准测试中取得显著提升。这些经验共同指向一个核心观察:没有固定的奖励函数能在策略能力持续增长时保持有效,验证必须与生成器共同进化。
查看原文
查看缓存全文

缓存时间: 2026/06/26 06:05

论文页面 - 验证地平线:编程智能体奖励没有银弹

来源:https://huggingface.co/papers/2606.26300 发表于 6月24日

·

提交者 zjj 于 6月26日

作者:, , , , , , , , , , ,

摘要

AI 智能体中的验证挑战源于将代理信号与人类意图对齐的困难,需要能够随着生成能力进化而演化的自适应验证系统。一个经典的直觉认为,验证一个解决方案比生成一个更容易。对于当今的编程智能体,这一直觉正在被颠覆:随着基础模型发展出更强的推理能力,工程框架也变得更加复杂,生成复杂的候选解决方案已不再困难——可靠地验证它们反而成了更难的问题。我们能够构建的每一个验证器都只是人类意图的代理,而非意图本身。这使得验证面临双重困难:首先,意图本质上是未充分指定的,因此很难忠实地检查它是否被满足;其次,在模型训练过程中,优化会扩大代理与意图之间的差距——表现为奖励破解或信号饱和。为了解决这一问题,我们从三个维度——可扩展性、忠实性和鲁棒性——来刻画验证信号的质量,并主张同时实现这三个维度是核心挑战。我们进一步研究了四种奖励构建方式:用于通用编程任务的测试验证器、用于前端任务的评分标准验证器、将用户作为真实世界智能体任务的验证器,以及用于长期任务的自动化智能体验证器。针对不同的任务类型和策略能力水平,我们对奖励设计的核心挑战以及如何更有效地利用奖励信号进行了深入分析和实验。实验表明,有针对性的验证设计可以有效抑制奖励破解,提高任务完成质量,并在多个内部和公开基准上取得显著收益。这些经验共同指向一个核心观察:随着策略能力的持续增长,没有固定的奖励函数能够始终保持有效;验证必须与生成器共同进化。

查看 arXiv 页面 (https://arxiv.org/abs/2606.26300) 查看 PDF (https://arxiv.org/pdf/2606.26300) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2606.26300)

在你的智能体中获取这篇论文:

hf papers read 2606\.26300

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有链接此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2606.26300 即可从此页面链接。

引用此论文的数据集0

没有链接此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2606.26300 即可从此页面链接。

引用此论文的 Space0

没有链接此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2606.26300 即可从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection),即可从此页面链接。

相似文章

验证视界:编码智能体奖励并无银弹

arXiv cs.AI

该论文指出,对于当前的编码智能体,验证解决方案比生成解决方案更为困难,且任何固定的奖励函数都无法随着能力增长而持续有效。作者通过四种奖励构建的实验表明,针对性的验证设计可以抑制奖励黑客行为并提升任务完成质量。

AgentV-RL:用智能体验证器扩展奖励建模

arXiv cs.CL

AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。