AI代理能完成任务但仍然算失败吗?
摘要
本文引入“验证税”(Verifier Tax)概念,将AI代理的结果分类为安全成功、不安全成功或失败,并为使用工具的LLM代理提出了一种双层验证架构。
许多关于AI代理的讨论都聚焦于代理是否完成了任务。但我认为有一个缺失的类别:代理可能完成了任务,但以不安全或违反政策的方式完成。例如,代理可能完成了工作,但使用了错误的工具、跳过了审批步骤、暴露了隐私信息,或者采取了本应被阻止的行动。在我们发表于ACM CAIS 2026的论文中,我们将此称为**验证税**。其理念是将结果区分为:* 安全成功 * 不安全成功 * 失败。我们使用τ-bench在工具型LLM代理场景中进行了研究,并提出了一种双层验证架构:先进行确定性检查,然后对更具上下文关联的情况使用基于LLM的验证器。主要结论:验证可以通过减少不安全成功来提升代理的安全性,但随着任务变长,也可能降低任务完成率。论文链接:[https://dl.acm.org/doi/full/10.1145/3786335.3813160](https://dl.acm.org/doi/full/10.1145/3786335.3813160) 好奇大家怎么看:如果一个AI代理完成了任务但违反了安全规则,这应该算成功还是失败?
相似文章
AI代理基准测试是否应区分“安全成功”与“不安全成功”?
本文讨论了AI代理基准测试中的“验证者税”概念,区分了安全成功(完成任务且不违反约束)与不安全成功(完成任务但违反约束),并质疑在考虑安全权衡的情况下如何正确衡量代理性能。
验证者税:工具使用型LLM智能体中依赖于任务步数的安全与成功权衡 [R]
本文提出了一个用于工具使用型LLM智能体的安全评估框架,引入了“验证者税(Verifier Tax)”的概念——一种依赖于任务步数的安全与任务完成之间的权衡。文章提出了一种双层验证架构,并使用Tau-bench场景展示了验证如何减少不安全成功,但随着任务步数增加也会降低任务完成率。
从自信地宣告完成到悄然失败:描述LLM智能体中的虚假成功
本文描述了LLM智能体中的“虚假成功”现象,即智能体声称任务已完成,但环境状态显示并非如此。研究发现,在多个基准测试中,虚假成功占失败的45%-75%。LLM评判器无法可靠检测到这一现象,而轻量级TF-IDF检测器能以更低延迟实现高AUROC,提示生产监控应使用校准检测器而非LLM评判器。
验证前沿:编码智能体奖励并无银弹
本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。
如何处理智能体完成长时间任务时的'验证鸿沟'?
讨论验证智能体在长时间任务后输出结果的困难,并提出是否使用批评者智能体或可追溯性工具来确保可信度。