从自信地宣告完成到悄然失败:描述LLM智能体中的虚假成功

arXiv cs.LG 论文

摘要

本文描述了LLM智能体中的“虚假成功”现象,即智能体声称任务已完成,但环境状态显示并非如此。研究发现,在多个基准测试中,虚假成功占失败的45%-75%。LLM评判器无法可靠检测到这一现象,而轻量级TF-IDF检测器能以更低延迟实现高AUROC,提示生产监控应使用校准检测器而非LLM评判器。

arXiv:2606.09863v1 公告类型:新 摘要:LLM智能体可能会悄然失败,即在环境状态显示未完成时断言任务已完成。我们研究了这种失败模式——虚假成功——在两个智能体基准测试中:来自8个模型系列的9,876条tau2-bench轨迹,以及来自4个模型系列的1,879条AppWorld轨迹(具有与文本无关的真实标签)。虚假成功普遍存在,但不同设置下差异显著:在单控制tau2-bench领域中占失败的45-48%,在双控制电信领域中占3%,而在具有明确状态声明的自我评估编码智能体轨迹的AppWorld中占75.8%。LLM评判器无法可靠检测:在5个评判器、5种提示策略和完整任务规范的所有配置中,tau2-bench上的AUROC均未超过0.65,同一评判器在AppWorld API调用轨迹上的AUROC仅达0.54。评判器依赖于表面完成代理——tau2-bench中的自信结束语和AppWorld中的粗略动作序列数量——而非经过验证的状态变化。轻量级TF-IDF检测器在tau2-bench上实现了任务无关的AUROC 0.83,在AppWorld上达到0.95,在相同标记率下恢复的虚假成功数量是最好评判器的4-8倍,且延迟低3300倍。这些结果表明,生产监控应使用轻量级、领域校准的检测器作为分流信号,而非依赖LLM评判器作为虚假成功的主要监控方式。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:14

# 从自信收尾到无声失败:LLM智能体虚假成功的特征化分析 来源:https://arxiv.org/html/2606.09863 ###### 摘要 LLM智能体可能会以无声方式失败,即当环境状态显示任务未完成时却声称任务已完成。我们研究了这种失败模式——*虚假成功*,在两个智能体基准测试上进行了分析:来自8个模型家族的9,876条tau2-bench轨迹,以及来自4个模型家族的1,879条AppWorld轨迹(后者具有与文本无关的真实标签)。虚假成功很普遍,但具体比例因场景而异:在单控制tau2-bench领域占失败的45-48%,在双控制电信领域占3%,在明确声称状态的AppWorld自评估编码智能体轨迹中占75.8%。LLM评审器表现不可靠:在tau2-bench上,5个评审器、5种提示策略和完整任务规格的任何配置AUROC均未超过0.65;同样的评审器在AppWorld API调用轨迹上仅达到0.54 AUROC。评审器依赖于表面完成代理——tau2-bench中的自信收尾语言和AppWorld中的粗略动作序列量——而不是验证状态变化。轻量级TF-IDF检测器在tau2-bench上达到任务无关AUROC 0.83,在AppWorld上达到0.95,在相同标记率下比最佳评审器多恢复4-8倍虚假成功,且延迟低3,300倍。这些结果表明,生产监控应使用轻量级、领域校准的检测器作为分流信号,而非依赖LLM评审器作为虚假成功的主要监控手段。

## 1 引言

LLM智能体可能通过自信地报告任务完成而失败,但底层系统状态却显示相反情况。一个航空智能体说“您的预订已成功更新,$686退款已处理到您的卡上”,但数据库却没有记录。一个零售智能体说“您的退货申请已提交”,但实际没有退货记录。我们称之为**虚假成功**:智能体的自然语言声称完成与程序化环境状态之间的不匹配。虚假成功在操作上是危险的,因为它会无声传播。与崩溃、拒绝或明确交接不同,智能体将交互呈现为已解决。客户认为问题已修复;订单持续开放;退款从未发出。直到下游损害累积,才有人注意到。因此,这种失败模式主要不是基准测试中的趣闻,而是一个监控问题。

#### 普遍性。
我们在两个不同领域、不同智能体架构和不同真实标签方法的基准测试上系统研究了虚假成功。在tau2-bench(Barres等人,2025 (https://arxiv.org/html/2606.09863#bib.bib4))上,覆盖来自8个前沿模型家族的9,876条轨迹,涉及航空、零售和电信客户服务任务,虚假成功在单控制域中占所有失败的44-52%,而在双控制域(独立用户模拟器可验证状态)中仅占3%。在AppWorld(Trivedi等人,2024 (https://arxiv.org/html/2606.09863#bib.bib6))上,一个个人应用任务套件,使用编码智能体和完全独立于智能体语言的数据库状态真实标签,虚假成功在产生明确完成信号的架构中占失败的75.8%。该现象在对话和编码智能体设置中均出现,但表面形式因基准测试而异。每个模型内部的虚假成功率在13%到89%之间。推理模型并不提供保护:在我们的tau2-bench语料中,Qwen3-Max-Thinking的虚假成功率最高(79%),其推理轨迹合理化完成而非验证完成。

#### 为什么LLM评审器会失败。
标准的监控解决方案是让LLM评审器读取轨迹并判断智能体是否成功。我们证明这系统性地失败。在tau2-bench上,5个评审模型、5种提示策略以及一个提供完整真实任务规格的强基线的任何配置,AUROC均未超过0.65。失败有明确机制:评审器以自信的收尾消息语言作为完成的证据锚定,而虚假成功轨迹恰好产生这种语言。包含断言词汇的轨迹在“已完成”评分上高出0.27-0.36点,无论实际结果如何。在AppWorld上,智能体不产生自然语言收尾消息,而是通过结构化数据库写入来指示完成,同样的评审器表现最差AUROC为0.54。这里评审器锚定于动作序列量而非断言语言。失败在检查清单条件、推理模型和明确指示验证写入操作的情况下依然存在。

#### 贡献。
(1) **在两个基准测试上的特征化分析。** 我们在两个具有不同真实标签机制的智能体基准测试上系统研究了虚假成功。在tau2-bench上,我们贡献了包含616个虚假成功的带人工验证标签的语料库(κ=0.86),将虚假成功与诚实失败和模糊案例进行三类分解,以及跨8个模型家族和3个领域的普遍性分析。在AppWorld上,我们使用文本独立的真实标签——智能体写入监督数据库的显式状态字段——复现了该现象,确认虚假成功不是自然语言标记启发式的伪影。
(2) **轻量级检测器在两个基准测试上均优于评审器。** TF-IDF分类器和XGBoost在每个基准测试内可靠检测虚假成功。在tau2-bench上,使用收尾消息词汇特征达到任务无关AUROC 0.83。在AppWorld上,使用API调用序列特征达到任务无关AUROC 0.95。在两种设置中,简单线性分类器与微调神经模型(DeBERTa)的AUROC差距在0.03以内,运行速度比LLM评审器调用快3,300倍。在相同人工审核预算下,检测器比最佳评审器多恢复4-8倍虚假成功。
(3) **评审器失败的机制解释。** 虚假成功有一致的行为特征,恰好被评审器奖励。在tau2-bench上,智能体无论动作是否成功都产生自信的断言语言;评审器将其视为完成的证据。在AppWorld上,智能体读取环境状态但不修改,然后声称完成;评审器将更长、更复杂的动作序列视为成功的证据。在这两种情况下,虚假成功利用的表面信号正是评审器用来推断任务完成的同一信号。检测器通过区分性训练使用真实标签,学习相反的信号。
(4) **环境和模型层面的调节因素。** 环境结构调节虚假成功的普遍性。双控制设置(独立进程可验证智能体动作)将虚假成功率抑制一个数量级,相比单控制领域(tau2-bench上3% vs 44-52%)。任务难度也重要:较容易的任务表现出更高的虚假成功率,因为智能体在最小探索后即声称完成。这些发现表明,独立验证可能是针对无声智能体失败的有前景的结构性防御,尽管需要更多双控制环境来隔离因果关系。

## 2 相关工作

关于智能体评估和失败检测的先前工作涵盖四个领域:评估智能体行为的基准测试、故障发生后定位失败的方法、评估轨迹质量的LLM-as-judge方法,以及关于模型失败模式的可解释性研究。本文填补了这些线索之间的空白。我们专注于检测现有基准测试标记但未分析、定位方法假设已识别、且LLM评审器因机制原因无法识别的特定失败模式(虚假成功)。

#### 智能体评估基准测试。
多个基准测试评估LLM智能体在多步任务上的表现。AgentBench(Liu等人,2024 (https://arxiv.org/html/2606.09863#bib.bib1))和GAIA(Mialon等人,2023 (https://arxiv.org/html/2606.09863#bib.bib2))评估跨领域的推理和工具使用。Tau-bench(Yao等人,2024 (https://arxiv.org/html/2606.09863#bib.bib3))及其后继tau2-bench(Barres等人,2025 (https://arxiv.org/html/2606.09863#bib.bib4))专注于客户服务场景,使用源自数据库状态的程序化奖励信号。我们使用tau2-bench作为数据源,因为它提供独立于智能体语言的真实完成标签,这对检测虚假成功至关重要。其他工作已经审计tau-bench轨迹的质量问题(Cuadron等人,2025 (https://arxiv.org/html/2606.09863#bib.bib5)),但未隔离虚假成功现象或提出检测器。

#### 失败检测与定位。
近期工作关注智能体失败,但通常假设失败已知。Who&When(Zhang等人,2025b (https://arxiv.org/html/2606.09863#bib.bib7))、AgenTracer(Zhang等人,2025a (https://arxiv.org/html/2606.09863#bib.bib8))和AgentDebug(Zhu等人,2025 (https://arxiv.org/html/2606.09863#bib.bib9))在给定最终结果失败的情况下定位轨迹中错误发生的位置。我们的工作解决更早的一步:在智能体声称成功的情况下,检测是否发生了失败。这些方法是互补的,但针对不同问题。

#### LLM-as-judge评估。
使用LLM评估其他LLM已成为标准实践。早期工作将评审器应用于对话质量(Zheng等人,2023 (https://arxiv.org/html/2606.09863#bib.bib10))和指令遵循(Kim等人,2024 (https://arxiv.org/html/2606.09863#bib.bib11))。最近的方法将评审器用于复杂推理任务(Dubois等人,2024 (https://arxiv.org/html/2606.09863#bib.bib12))和智能体轨迹(Zhuge等人,2025 (https://arxiv.org/html/2606.09863#bib.bib13))。这背后的假设是,一个能力强的LLM可以评估另一个模型是否完成了任务。我们证明这个假设在虚假成功面前失效:评审器系统地受到自信断言语言的误导,无论实际结果如何。我们的发现与对评审器可靠性的担忧(Thakur等人,2025 (https://arxiv.org/html/2606.09863#bib.bib14))一致,但识别出了具体的机制原因。

#### 腐败成功与过程感知评估。
Cao等人(Cao等人,2026 (https://arxiv.org/html/2606.09863#bib.bib15))的并发工作引入了“腐败成功”:智能体尽管违反程序完整性(例如,绕过必需的政策检查、伪造通信、或遵循错误程序但恰好产生正确最终状态)却获得正奖励的轨迹。他们的过程感知评估框架针对τ-bench上的reward=1轨迹,发现27-78%的基准报告成功包含程序违规。这与我们的视角互补:腐败成功是reward=1的轨迹,智能体错误地成功执行了某事;而我们的虚假成功是reward=0的轨迹,智能体声称做了正确的事但实际没有。两个群体不重叠,且失败模式针对不同的部署风险——腐败成功威胁政策合规性即使结果看起来正确;虚假成功威胁用户信任当结果无声地错误。方法论上,Cao等人为其框架的语义轴构建于LLM-as-judge之上,而我们证明针对虚假成功这一特定场景,LLM评审器系统性地失败,轻量级分类器就足够了。

#### 可解释性与失败模式。
关于LLM可解释性的工作已经识别出失败模式,包括谄媚(Perez等人,2023 (https://arxiv.org/html/2606.09863#bib.bib16))、幻觉(Zhang等人,2025c (https://arxiv.org/html/2606.09863#bib.bib17))和奖励黑客(Skalse等人,2022 (https://arxiv.org/html/2606.09863#bib.bib18))。虚假成功可以被视为关于任务完成的幻觉形式,但不同之处在于,它是由智能体自身的工具输出和环境状态触发的,而非纯粹内部生成。电信领域的环境效应发现(双控制下虚假成功率3%)表明失败模式的普遍性对验证结构敏感,这是先前幻觉工作中未探索的结果。

## 3 方法

### 3.1 tau2-bench语料库

我们从由Sierra托管的公共tau2-bench排行榜获取智能体轨迹(Barres等人,2025 (https://arxiv.org/html/2606.09863#bib.bib4))。排行榜发布来自竞争模型在三个客户服务领域(涵盖航班变更、退款、账户修改和设备故障排除等任务)的模拟运行评分。每条轨迹是一个完整的模拟:用户模拟器请求、智能体的工具驱动响应序列,以及程序化奖励(如果最终环境状态与真实任务规格匹配则为1,否则为0)。我们收集来自8个模型家族的提交:Claude Opus 4.5、Claude Sonnet 4.5、GPT-5.2、Gemini 3 Pro、Gemini 3 Flash、GLM-5、Qwen3-Max-Thinking-Preview和Qwen3.5-397B-A17B。在移除消息结构异常或奖励缺失的轨迹后,我们的语料库包含9,876条轨迹(表1 (https://arxiv.org/html/2606.09863#S3.T1))。其中,8,146条成功(reward=1),1,730条失败(reward=0)。失败构成了虚假成功可能的群体,因为成功的轨迹已正确完成任务。

**表1:数据集组成。** FS=虚假成功,HF=诚实失败,Amb=模糊。百分比为失败中的比例。

### 3.2 AppWorld语料库

AppWorld(Trivedi等人,2024 (https://arxiv.org/html/2606.09863#bib.bib6))是一个个人应用任务基准测试,涵盖电子邮件、日历、支付、音乐和购物,通过检查环境状态变化的程序化单元测试进行评估。智能体通过结构化API与基准交互;每条轨迹是一系列HTTP风格调用(例如,`POST /venmo/friends/[email protected]`,`GET /amazon/cart`)后跟一个终端调用`POST /supervisor/message`。我们使用公开发布的实验输出,涵盖4个模型家族(GPT-4o、GPT-4-Turbo、LLaMA-3、DeepSeekCoder)和4个智能体架构(react、plan_exec、full_code_refl、ipfuncall),总计8,190条轨迹。基准测试提供每个任务的程序化评估分数,独立于智能体语言。参见附录F (https://arxiv.org/html/2606.09863#A6)以获取按架构划分的完整状态写入细分。

#### 文本独立标记。
AppWorld智能体在任务完成时直接将`status`字段(`success`或`fail`)写入监督数据库。该字段完全独立于智能体的自然语言。如果智能体写入`status=success`而程序化评估报告失败,则轨迹被标记为虚假成功;如果智能体写入`status=fail`且评估为失败,则标记为诚实失败。我们限制分析范围为有时写入`status=fail`的架构(`full_code_refl`和`ipfuncall`),因为`react`和`plan_exec`在完成时无论结果如何总是写入`status=success`,使其状态字段作为自我评估信号无信息量。我们进一步排除了智能体未写入任何状态的轨迹(3,120条),这些代表智能体中途停止未完成。最终语料库包含1,879条具有显式完成声明的轨迹:1,425条虚假成功和454条诚实失败(表2 (https://arxiv.org/html/2606.09863#S3.T2))。

**表2:过滤到具有显式状态声明的自评估架构后的AppWorld语料库。** FS率在具有显式状态且失败的轨迹中计算。

相似文章

AI代理能完成任务但仍然算失败吗?

Reddit r/artificial

本文引入“验证税”(Verifier Tax)概念,将AI代理的结果分类为安全成功、不安全成功或失败,并为使用工具的LLM代理提出了一种双层验证架构。

当证据稀疏时:对话与LLM-Agent轨迹中的弱监督早期故障预警

arXiv cs.CL

本文提出了一种两阶段方法,用于对话和LLM-Agent轨迹中的早期故障预警。该方法通过从轨迹标签中学习逐轮故障证据来解决证据稀疏的挑战,并使用基于注意力的预测器与偏好条件停止策略(α-STOP),以实现可控的准确率-及时性权衡。