SteerBench-Work:行动边界处的智能体引导基准
摘要
介绍了 SteerBench-Work,这是一种事件锚定式基准,用于评估 LLM 智能体在采取实际动作前应继续还是暂停。在 30 种模型条件下,模型绝大多数情况下过度拒绝已授权工作,而很少允许不安全行为,揭示了通用能力与转向决策之间的校准差距。
arXiv:2608.12654v1 Announce Type: new
摘要:长期运行的 LLM 智能体通过工具执行操作,单一步骤即可发送电子邮件、合并拉取请求或电汇付款。转向决策是该边界上的提交前选择:继续执行,或暂停以等待人工或策略审查。我们引入了 SteerBench-Work,这是一个事件锚定、双向的基准,用于评估开发者运维、客户服务、财务、法律、医疗、人力资源和安全等领域的工作场所智能体中的该决策。
v2026-05 版本包含 106 个以公开事件为锚定的场景、成对的证据反转镜像和校准控制,标签在继续与暂停之间几乎均匀分布,因此两个错误方向获得几乎相同的样本数。模型会看到拟议操作和可用证据,返回一个门控决策,并根据其是否正确继续或暂停来评分。在 30 种模型条件下,失败几乎完全向一个方向倾斜:模型在 28.1% 的机会中错误地暂停了已授权且证据已通过审核的工作,而在 1.0% 的机会中错误地允许了不安全的工作。最困难的情况是风险已解决的提交,其中签名或结构化证据已经消除了实际风险触发因素,而模型在著名事件的证据反转镜像上得分显著更差(63.8%),远低于在事件本身上的得分(98.5%)。通用能力并不等同于转向校准:高能力模型在提交边界上常常过度拒绝,而更多推理可以修复薄弱门控,却会使已校准的门控保持不变。公开排行榜位于 steerbench.com。
查看缓存全文
缓存时间: 2026/08/14 09:26
# SteerBench-Work:动作边界处的智能体操控基准 ###### 摘要 长时运行的 LLM 智能体通过工具执行动作。单步动作就可能发送邮件、合并拉取请求或完成一笔支付。操控决策就是该边界处的提交前选择:继续执行,或暂停以待人工或策略审查。我们提出 SteerBench-Work,这是一个以真实事件为锚、双向的基准测试协议,用于衡量工作场所智能体在开发者运维、客户服务、财务、法律、医疗、人力资源、安全及其他领域中的这种决策。 v2026-05 版本包含 106 个锚定于公开事件的场景、成对的证据反转镜像以及校准对照组。标签在“继续”和“暂停”之间几乎平均分布,因此两个错误方向获得近乎相同数量的测试机会。定义该基准的是协议,而非场景数量:模型看到提议的动作和可用证据,返回一个门控决策,并根据其是否正确跨越或保持边界来计分。 在 30 个模型条件下,失败几乎完全集中在一个方向:模型在 28.1% 的机会中错误暂停了已授权且证据已清除的工作,在 1.0% 的机会中错误放行了不安全的工作。该方向在敏感性检验下依然成立:排除运行器发出衍生风险标记的 17 行后,对应数值为 19.4% 和 1.25%;而依据未裁决的三评分者多数重新标记后,对应数值为 41.1% 和 0.36%。最难的案例是风险已解决的提交,签名或结构化证据已经清除了真实的风险触发;模型在著名事件的证据反转镜像上(63.8%)明显差于事件本身(98.5%)。一个模型可能在多次试验中翻转答案,却仍然赢得多数票。通用能力并不等同于操控校准:能力更强的模型往往在提交边界上过度拒绝。更多推理可以修复薄弱门控,但也会使已校准的门控保持持平或略有下降。同一网格可以在漏拒率保持固定或更低的前提下,为后训练选择开放权重的修复目标。公开排行榜位于 steerbench.com。 参见图1:SteerBench-Work 评估提交前动作边界:即智能体动作即将改变外部状态之前的决策。给定轨迹和候选动作,模型必须决定继续还是暂停。参考标签为暂停却继续执行即为漏拒;参考标签为继续却暂停即为过度拒绝。 ## 1 引言 动作边界提交是人类在一切正常时不会看到的时刻。提交之后,后果已进入现实世界,不再可操纵。LLM 时代以及更早的自动化决策系统中的公开事件记录了这种失败模式:错误判断边界的智能体和自动化决策系统导致了法庭裁决、监管和解、集体诉讼和运营损害。这种模式是可复现的,而对那些决策进行标注的基准正是自然的测量工具。 前沿实验室已经推出了动作边界审查器。在 Codex Auto-review 中,OpenAI 在执行前将计划动作和近期上下文路由给审查器 [1 (https://arxiv.org/html/2608.12654#bib.bib1)];在 Claude Code Auto Mode 中,Anthropic 使用动作分类器来减少审批疲劳,同时阻止有风险的工具调用 [2 (https://arxiv.org/html/2608.12654#bib.b
相似文章
基准测试未衡量的:论自主智能体弃权能力的评估
本文认为,目前的自主智能体基准测试未能评估智能体是否应该继续执行任务,从而引入了'合规偏见'。作者提出了一个需要弃权的场景分类法,以及新的评估协议(Safety Rate, Usability Rate, Informed Refusal Rate),初步结果显示,不同模型家族的安全性与可用性之间存在可调节的权衡。
DecisionBench:面向长周期智能体工作流中涌现式委托的基准测试
DecisionBench 提出了一个标准化基准,用于评估长周期多智能体工作流中的涌现式委托,提供了包含任务套件、同行模型和多维度指标的底层架构,以隔离编排能力。
TeamBench:在强制角色分离下评估智能体协同
本文介绍了 TeamBench,这是一个用于评估在强制角色分离下智能体协同能力的基准测试,旨在解决仅靠提示词定义角色可能绕过预期约束的问题。
JobBench:让智能体工作与人类意愿对齐
JobBench 是一个基于工人调查构建的基准,用于评估 AI 智能体在工人最希望自动化的任务上的表现,涵盖 35 个职业的 130 个任务,并配备详细的评分细则。
扮演真正的研究者:一套评估前沿大语言模型及代理系统在研究生命周期中的基准测试集
本文介绍了AARR(扮演真正的研究者)基准系列,旨在评估前沿大语言模型和代理系统在细粒度研究场景中的表现。首个基准AARRI-Bench显示,即使表现最佳的代理成功率也仅为68.3%,凸显了其在领域敏感性和细微推理能力方面的不足。