@hanakoxbt: https://x.com/hanakoxbt/status/2083540339147567268

X AI KOLs Timeline 新闻

摘要

一份六步指南,教你构建评估门控,让AI代理自主合并变更,涵盖评判偏差、运行时评估、轨迹评分等内容。

https://t.co/nOScaNHEzE
查看原文
查看缓存全文

缓存时间: 2026/08/03 01:38

评估工程:构建让智能体无需你就能合并的门禁(完整6步教程)

最终的理想状态很容易描述:智能体完成一项变更,发起合并请求,然后它在没有人类审阅的情况下被合并进去。

不是因为有人决定信任模型,而是因为一道门禁读取了证据,并且对证据有规则可循。

几乎没有人拥有这样的门禁,原因不是缺乏勇气。

而是门禁需要读取的证据,在大多数系统中还不存在。

以下是在你能够打开它之前必须先具备的条件,共六步。

第1步 - 你看到的分数有一部分反映的是你的评判者

自动化评估起源于一个可靠的结果。

2023年,加州大学伯克利分校的Zheng及其同事表明,GPT-4在超过80%的情况下与人类评分者一致,大致相当于人类彼此之间的一致率。整个行业几乎一夜之间转向了API调用。

后续研究发现的是:评判者会响应眼前内容之外的其他因素。

前沿评判模型会系统性地抬高自己模型家族输出的分数。

在某个2026年的基准测试中,GPT-5.2和Gemini 3.1 Pro给自己的模型家族打出75%到84%的胜率。Claude Opus 4.7则反其道而行之,低估自己家族,给出10.6%到41.2%的胜率。

在ArenaHard上,各评判者之间的测量偏差从-38%到+90%。

同一个基准测试将一组输出分别交给两个不同的评判者。在其中一个评判者下,模型得分93.3%;在另一个评判者下,相同输出得分39.5%。

冗长偏差与之并存:评判者会奖励长度,不管多余的字词是否携带信息。

这些都不会让该方法变得无用,而是让配置成为关键。以下三条规则能覆盖大部分情况:

  • 评判者应与生成方来自不同的模型家族。同一家族意味着共同的盲区。
  • 对于任何高风险场景,使用来自不同厂商的评判者小组,而不是单个评判者。跨家族取平均才能打破相关错误。
  • 任何可客观检查的事项都交给代码,而不是评判者。测试是否通过、文件是否存在、状态是否改变。

由有偏见的评判者喂养的门禁比没有门禁更糟。

它把猜测洗成数字,然后按其行动。

第2步 - 不改变运行过程的裁决只是一份报告

大多数团队都差一步。

他们得到一个数字,放到仪表盘上,而仪表盘没有改变任何人的行为。

2026年成熟起来的转变是在智能体内部运行评估,而不是在其之后。预生产评估被提升为生产护栏,分数控制智能体接下来可以做什么:它能访问哪些工具、交接是否被接受、运行是否升级给人工。

这就是温度计与恒温器之间的区别。

每个裁决都映射到进行中运行的一个结构性动作。

低依据性拒绝交接。

模式失败会阻断这条边。

疑似捏造的内容会隔离该分支,而不是让它合并到主线程中。

只有经过验证的完成才被允许结束运行。

一个停止调用工具的智能体只是结束了它的回合。这与完成任务不是一回事,只有外部检查才能分辨这种区别。

这是门禁复用的第一件事。在一个裁决已经引导运行的系统里,这些裁决在合并时值得被读取。

第3步 - 评估路径,而不只是答案

如果只评估最终响应,智能体可能通过一条有缺陷的序列得到正确答案,而一个月内无人察觉。

智能体评估分为三个层级,你需要全部三个。

端到端检查任务是否成功。

轨迹层级检查路径是否稳健,循环、冗余调用和浪费的步骤就在这里浮现。

组件层级检查是哪个检索器、工具或子智能体出了问题。这是唯一能告诉你去哪里修复的层级。

三个指标足以起步。

忠实度(Faithfulness),意思是答案基于工具实际返回的内容,而不是模型在工具返回空结果时自行填充的内容。

工具参数准确率,即正确的工具配上正确的参数。

任务完成度,依据真实信号判断,而不是智能体自己的声明。

忠实度是最容易被隐藏的。一个写得干净利落、却自行编造汇率的智能体,会在你看板上的每个质量指标上得高分,而编造的内容只有当客户据此行动时才会浮出水面。

对于门禁而言,轨迹比最终答案更重要。

经由干净路径到达的变更,与经过四十步反复折腾后到达的相同变更,是不同等级的风险,即使diff看起来一模一样。

第4步 - 你最好的测试已经在你的日志里

你在办公桌前编造出来的测试,只能保护你免受你已经想象到的失败。

真正昂贵的测试现在就躺在你的追踪记录里,上面带着时间戳。

抽取一小撮完整的运行记录,选择时让正常行为和异常行为相邻出现:

一个顺利完成请求,作为“正常表现”的基线。

一个用户改写或纠正过的请求,因为纠正本身就是免费的标签。

一个工具返回空结果、或使用相同参数被调用两次的运行。

一个外部超时的运行,这里唯一测试的是当外部世界说“不”时你的智能体如何表现。

把每一条写成四行:智能体做了什么,哪些有效哪些无效,原因是你的智能体还是依赖项,以及这条评估应保护哪项能力。

归因是人们浪费一周时间的地方。

相同参数的两次相同查询,是智能体内部的一个循环。

速率限制返回是别人的问题,只有当你的智能体本应从其中恢复时,它才成为你的评估项。

两条规则能保证这一点不失真。

追踪记录告诉你智能体做了什么,从来不告诉你它本该做什么,因此答案标准来自测试、记录、策略或人。

在信任验证器之前先测试它。给它一个明显正确的结果和一个看似合理的错误结果。如果任何一个被误判,那么是评分标准出了问题,而不是智能体。

每一个这样转化出来的失败,门禁都不会再被它突袭第二次。

第5步 - 锁定评判者版本,否则浪费一个月

评判者是带版本的软件。

一个悄悄升级的评判者会让前后的所有分数变得不可比。

这种失败是悄无声息的。评判者某个月升一个小版本,下个月再升一个大版本,你的测试套件继续产生数字,而这些数字在几周前就已经不再表示原来的含义。

锁定版本,并把版本与每个分数一起记录。

把评分标准写成一行,形式为:如果独立可观测的结果发生了,则通过;而不是一捆代理分数。

永远不要奖励答案的形状。不要为长度、关键词出现、引用数量或与参考的相似度给分。

最后一条不是风格偏好。

只要足够用力地去针对评判者优化,智能体就会学会看起来正确而不是真的正确,这会把你的防御变成攻击面。这就是带模型在环的古德哈特定律。

在依赖自我审查之前,还有一件值得知道的事。

DeepMind的Huang及其同事在ICLR 2024上表明,内在自我修正——即让模型在没有外部依据的情况下审查和修改自己的工作——并不能可靠地提供帮助,反而常常使事情更糟。

依据必须来自模型之外。

把测试套件设计得足够大,以便在实战中依然存活。

2026年的工作指引是:在信任一个聚合数字之前至少要有500个案例,而且运行时间要短到没有人需要围绕它做计划。

一个比喝杯咖啡还耗时的测试套件,就会变成季度例行公事。

第6步 - 基于爆炸半径打开门禁,而不是基于置信度

大多数文章正是在这里出错。

他们构建一个置信度分数,设一个阈值,然后让所有高于阈值的东西通过。

置信度是那个决策中最弱的变量。

最强的是如果变更出错会发生什么。

按错误撤销成本对工作进行分类,并对每条通道设置不同的门禁:

  • 可逆且影响有限。一个文案修改、一个测试、一个有覆盖率覆盖的孤立函数。一次糟糕的合并代价是回滚。这条通道可以最先打开。
  • 可逆但影响广泛。一个共享工具、一个新增的schema、任何被十几个调用者使用的东西。这类变更要基于确定性检查加上干净的轨迹来把关。
  • 难以逆转。迁移、删除、任何写入生产数据或移动资金的操作。这条通道无论分数如何都不打开。

在打开的通道内部,门禁读取的是证据,而不是观点。

首先处理确定性结果,因为没有模型参与:测试、类型、schema、沙箱执行。

然后是此智能体版本的评估轨迹。

然后是历史记录,即该智能体在此领域的工作之前被回滚的频率。

模型自己的评估是门禁最不该重视的输入,因为这是唯一一个模型可以影响的输入。

谨慎地开启它。

先以影子模式运行,即门禁给每个变更打分但不合并任何一个,直到你有足够的真实流量进行比较。

追踪门禁与人类审阅者意见不一致的频率,只要这个数字显著大于零,

相似文章

解密 AI Agent 的评测方法

Anthropic Engineering

Anthropic 发布了一份指南,介绍如何为 AI Agent 设计严谨的自动化评测方案,重点解决了多轮交互和状态修改带来的复杂性挑战。

@rohanpaul_ai: 来自剑桥大学、英伟达及其他顶尖实验室的新论文教会AI智能体和AI评判者共同改进,使任何一方都不会……

X AI KOLs Following

来自剑桥大学、英伟达及其他实验室的一篇新论文介绍了Red Queen Gödel机器,这是一种让AI智能体及其评估者共同进化以防止停滞的方法。该方法通过允许评判者在安全交接点改进来避免固定基准,从而在编程和论文写作任务中取得更好的性能。