生成减少智能体评估中过度信任的无奖励评判标准

arXiv cs.AI 论文

摘要

RubricForge从带标签的轨迹中诱导评估标准,以减少语言模型智能体评估中的过度信任,增强保真度,而无需环境访问。

arXiv:2608.13564v1 Announce Type: new 摘要:大规模评估语言模型智能体越来越依赖第二个语言模型作为自动评判器,因为黄金信号,即可执行环境奖励,在部署时昂贵、缓慢或不可用。这种评判器是一个无奖励代理,其价值取决于是否值得信任,然而现有的评判器要么手写评分标准,如在G-Eval中,要么微调评判器的权重,两者都倾向于将流畅但不成功的轨迹归类为成功。相反,我们从一组少量真实标签轨迹中诱导智能体评判标准的文本,将其基于真实结果。我们提出RubricForge,它通过针对标签轨迹的反思进化来演化评判标准,以最大化与环境奖励的一致性,冻结它,并在无环境访问的情况下,通过一次模型调用将其应用于保留轨迹。优化的产物是人类可读的文本,因此每个判定都可归因于命名的标准。使用一个冻结的7B模型作为智能体和评判器,在tau-bench(从220次展开中抽取的173条标签轨迹)和WebShop(160条)上,主要收益是保真度而非原始一致性。相对于通用G-Eval评判器的优势在统计上不显著(McNemar p = 0.248),且绝对分数校准略微偏向通用评判器(|err|差异 -0.048,p = 2x10^-4)。然而RubricForge过度信任失败轨迹的频率大约减半(在tau-bench上为0.115对0.173的误通过率,有三次过度信任捕获和零次反转),并更忠实地排名分级WebShop结果(Spearman 0.410对0.370)。对于无奖励评估器,误通过率而非总一致性,是部署相关的量,因为误通过会部署一个损坏的智能体,而误失败仅增加重试成本。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:36

# 通过无奖励评判标准减少智能体评估中过度信任现象
来源:https://arxiv.org/html/2608.13564
Darragh Quinn、David Dylan、Roisin Healy、Fionn Carroll、Maeve Donnelly 与 Cormac Sheehan。D. Dylan、D. Quinn 和 M. Donnelly 隶属于都柏林三一学院;R. Healy 和 C. Sheehan 隶属于都柏林大学学院;F. Carroll 隶属于都柏林城市大学,均位于爱尔兰都柏林。

###### 摘要
大规模评估语言模型智能体日益依赖第二个语言模型作为自动评判者,因为黄金信号——可执行环境奖励——在部署时成本高昂、速度缓慢或不可用。此类评判者是无奖励代理,其价值取决于是否值得信任,但现有评判者要么手动编写评分标准(如G-Eval),要么微调评判模型权重,这两种方法都倾向于将流畅但未成功的轨迹误判为成功。我们转而从少量具有真实标签的轨迹中归纳出智能体评判标准文本,将其建立在真实结果之上。我们提出RubricForge,该方法通过针对标记轨迹的反思性进化来生成评判标准,以最大化与环境奖励的一致性,然后将其固定,并在一次模型调用中应用于留出轨迹,无需访问环境。优化后产出的是人类可读的文本,因此每个判断都可归因于明确的评判标准。

使用同一个冻结的7B模型作为智能体和评判者,在τ-bench(从220次执行中抽取的173条标记轨迹)和WebShop(160条)上,主要收益体现在忠实性而非原始一致性上。与通用G-Eval评判者相比,其优势不具统计显著性(McNemar p=0.248),绝对分数校准略微偏向通用评判者(|err|差异-0.048, p=2×10⁻⁴)。然而,RubricForge将失败轨迹误判为成功的概率大约只有前者的一半(在τ-bench上误通过率0.115 vs. 0.173,捕获三次过度信任且无反转),并且对WebShop分级结果的排序更忠实(Spearman相关系数0.410 vs. 0.370)。对于无奖励评估器,误通过率而非整体一致性是部署相关的关键指标,因为误通过会部署故障智能体,而误失败仅需重试。

###### 索引关键词:自动评估、评估指标、智能体、可解释性、大型语言模型、LLM作为评判者、提示优化、奖励建模、可信机器学习。

**请参见插图**
**图1:** RubricForge概览。评估标准通过反思性进化从具有真实标签的智能体轨迹中归纳得出,然后固定并通过一次模型调用应用于留出轨迹,无需访问环境。左图:与通用G-Eval评判者相比,二元一致性优势是定向的且*不*具有统计显著性(McNemar p=0.248)。右图:关键之处在于,归纳出的标准将流畅但失败的轨迹误判为成功的概率大约只有一半(在τ-bench上误通过率0.115 vs. 0.173),这是无奖励评估器部署相关的误差。因此,RubricForge更难被欺骗,而非仅仅求同。

## I 引言
语言模型智能体——将推理与工具调用交织以在外部环境中行动的系统——目前正以无法接受人类评估每条轨迹的规模进行评估、调试和排名[65, 43, 52, 47]。最清晰的评估信号是*环境奖励*:一种程序化预言机,在交互结束后检查世界状态并返回成功或分级分数——例如客户服务模拟器中的数据库哈希、购物环境中的属性匹配、或代码智能体的通过测试套件[63, 62, 14]。此类预言机构成了本文构建的黄金标准。但它们恰恰是人们最需要时往往缺乏的东西。在开发阶段,人们希望以低成本对数千个候选执行进行评分;在部署阶段,环境就是生产系统本身,破坏性的“黄金标准”探测(如执行退款、下单、修改记录)恰恰是必须*避免*仅为了评估智能体而运行的。因此,该领域转向了*LLM作为评判者*:第二个语言模型阅读轨迹并预测智能体是否成功[71, 28, 10]。

评判者是*无奖励代理*——一个从未查询过预言机的学习替代品。代理只有在值得信任时才有用,而评判者已知会以特定方式失败:它们偏好冗长、流畅、自信的回答[53],倾向于自己的生成内容[37],并且奖励表面形式胜过实质内容。对于*智能体*评判者,这些偏见集中于一种代价特别高昂的错误。轨迹可能读起来很完美——智能体认证用户、叙述计划,并以精炼的确认结束——但底层操作失败了:预订出错、记录未提交、购买的物品与要求不符。评判者奖励叙述过程而*过度信任*了失败。

我们认为,决定无奖励评估器是否安全部署的正是这一种错误类型,而非整体一致性,因为二元评判者犯错的两种方式并不对称。*假通过*——将真正失败的轨迹评为成功——会静默认证并部署故障智能体:它会虚增报告的成功率、掩盖回退,并在优化过程中选择不良策略。*假失败*——将真正成功的轨迹评为失败——仅需要重试或丢弃样本。风险是不对称的,因此指标也应如此。本文研究的是智能体评判标准的*文本*应该是*编写*还是*归纳*。主流做法是手动编写标准——G-Eval用人类撰写的标准提示强大模型[28]——或微调评判者的*权重*[19, 20, 74]。我们采取第三条路径:保持评判模型*冻结*,而是通过针对少量具有真实标签轨迹的反思性进化来优化标准*字符串*,使用每条轨迹的真实环境结果作为监督信号。归纳出的标准随后被固定,并在一次模型调用中应用于按任务不相交划分的留出轨迹,无需访问环境。我们称此为RubricForge。

因为优化的对象是人类可读的文本,所得指标在设计上就是可解释的:每个判断都可归因于从业者可检查、编辑和审核的命名标准。并且因为归纳将标准建立在真实结果而非评判者不受约束的直觉之上,我们假设它更能抵抗将流畅的失败误判为成功。我们的核心结果区分了文献中常被混淆的两个问题:评判者是否与预言机整体一致,以及它是否会在危险方向上出错。对于困难的二元成功标签,冻结的7B评判者已接近其一致性上限,RubricForge并未显著超越通用G-Eval评判者;在分级的WebShop任务上,通用评判者在绝对分数上实际上校准得略好。我们不做修饰地报告这两种结果。然而,在误通过率方面,RubricForge将流畅失败误判为成功的概率大约只有一半,并且在τ-bench上两者差异完全归因于三条轨迹,全部是RubricForge捕获的过度信任实例,无反转。因此,整体一致性是无奖励评估器的错误头条:归纳基本保持其不变,同时大幅减少了决定代理是否可安全部署的错误。

这引发了关于在提示空间中进行优化的更广泛问题。当优化目标与现实结果脱节时,优化的提示可能漂移或崩溃;将相同的优化建立在可验证信号上才能保持其有用性。RubricForge将标准归纳建立在标记的轨迹结果之上,这正是使归纳代理能够抵抗偏离真实奖励的关键,我们将在第II节和第VIII节中讨论其与古德哈特定律的联系。

**贡献。** 本文的主要贡献总结如下:
- **RubricForge:智能体的自动指标归纳。** 我们引入一种方法,针对具有真实标签的轨迹在*冻结*的骨干模型上进化评判标准,然后固定标准并通过一次模型调用且无需环境访问来对留出轨迹评分(第IV节)。归纳可靠地提高验证集一致性(τ-bench上0.654→0.769,WebShop上0.667→0.750),并产生具体、人类可读、基于轨迹的标准。
- **归纳的收益在于忠实性而非一致性。** 我们展示RubricForge将失败轨迹误判为成功的概率大约只有通用评判者的一半(τ-bench上误通过率0.173→0.115;捕获三个流畅失败实例,零反转),在任何项目上得分都不比G-Eval差——同时明确指出二元一致性差异是定向的且*不*显著(McNemar p=0.248)。
- **对分级结果的更好排序。** RubricForge对WebShop分级结果的排序更忠实(Spearman相关系数0.410 vs. 0.370),尽管绝对校准略微偏向通用评判者(|err|差异-0.048, p=2×10⁻⁴)。我们区分了排序忠实性和绝对校准,并两者兼报。
- **一种无奖励评估协议和过度信任探测。** 我们将预言机奖励上限、假通过率、排序与校准的分离、基于标准的留一归因、以及难度/流畅度/长度分层打包成一个可复用的协议(第VII节),并将假通过率与代理目标失配和古德哈特定律联系起来。

**路线图。** 第II节综述LLM作为评判者、奖励建模、智能体基准、提示优化和代理失配。第III节形式化无奖励轨迹评估。第IV节展示带有算法和架构图的RubricForge。第V节详述数据集、基线和协议;第VI节报告主要表格;第VII节是忠实性诊断。第VIII节讨论影响与局限,第IX节总结。

## II 相关工作
我们将文献组织为五个主题:(a) LLM作为评判者和自动评估,其中我们的探测所测量的假通过失败被命名;(b) 奖励建模、RLHF/RLAIF和学习评估器;(c) 智能体基准和评估;(d) 提示优化和进化;(e) 代理/指标失配和古德哈特定律。贯穿始终,我们标记了RubricForge的差异化:先前的评判者要么*手写*标准,要么*微调*评判者权重,而RubricForge通过进化*归纳*标准*文本*,同时保持评判模型冻结。

### II-A LLM作为评判者和自动评估
使用强大的语言模型来评分另一个模型的输出已成为人类评估的默认可扩展替代方案。G-Eval用一个手写标准和基于思维链的表单填写协议提示一个有能力的模型来评分类语言生成[28];MT-Bench和Chatbot Arena确立了LLM和人类成对评判作为聊天模型的基准基础[71]。一条互补的线路训练专用的*开放*评估器:Prometheus和Prometheus 2微调模型以应用细粒度、用户提供的评分标准并近似GPT-4级别的判断[19, 20];JudgeLM、PandaLM和Auto-J为指令遵循和成对比较微调可扩展评判者[74, 55, 26];FLASK将评估分解为技能集[66];聚合方案如分支-解决-合并以及多样化评审模型小组减少了单一评判者方差[40, 50]。同样的机制越来越多地转向*智能体*而非单一响应——PersonaGym对角色条件智能体评分,CharacterEval评估多轮角色扮演行为[41, 49]——这正是RubricForge所针对的领域。综述记录了这一快速发展的空间[10, 24, 25]。对我们至关重要的是,同一条线路记录了评判者是*有偏估计器*,它们以特定的危险方向失败。LLM评估器并不公平:它们受到答案位置、冗长性和表面流畅性的影响[53];它们识别并偏爱自己的生成内容[37]。这些偏见正是产生*假通过*——将流畅但失败的轨迹评为成功——的原因,这也是我们的过度信任探测所隔离和测量的错误。从这个角度看,归纳的智能体标准是真实环境奖励的*学习代理*,假通过率是该代理与奖励之间差距的操作化度量[60]。RubricForge与上述所有方法在*优化什么*上不同:G-Eval固定手写标准;Prometheus和JudgeLM移动评判者权重。RubricForge保持评判模型冻结,并针对真实标签优化标准*字符串*——比微调更便宜,比手写更忠实,并且由于产出物是文本,在设计上可解释。

### II-B 奖励建模、RLHF和学习评估器
学习评估器在基于偏好的对齐中有着悠久的血统。基于人类比较训练的奖励模型推动了摘要和指令遵循的RLHF[46, 34];RLAIF用AI反馈和宪法自我批评取代或增强人类信号[22, 4]。

相似文章

C2:基于二元偏好的可扩展评分增强奖励建模

Hugging Face Daily Papers

C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。

逆评分优化:智能体科学的测试平台

Hacker News Top

Fulcrum Research 提出了逆评分优化(IRO),这是一个用于研究长期智能体行为的测试平台,其中智能体必须优化黑箱法官的偏好。该方法实现了平滑扩展和丰富的行为分析,实验表明,Fable 5 和 Opus 4.6 等前沿模型具有不同的扩展特性。

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。