可操作的幻觉检测:将潜在不确定性转化为智能体批判
摘要
本文介绍了 Latent Critic,一种轻量级 LoRA 适配器,它通过将 Transformer 的残差流重构为局部自然语言反馈,实时检测幻觉智能体行为,达到 0.966 的 AUROC,并支持自我纠正。
arXiv:2608.10430v1 公告类型:新
摘要:大规模语言模型(LLMs)作为人工智能智能体部署时,经常出现用户规范锚定失败,执行幻觉式的、不符合预期的动作来强行解决问题,而不是表达不确定性。现有的检测方法无法提供可操作的实时纠正,因为它们要么无法定位幻觉,要么产生过高的推理延迟。我们提出了 Latent Critic——一种轻量级低秩适配器(LoRA),它与冻结的基础 LLM 的生成过程并发运行,主动重构 Transformer 的残差流——在单个序列内放大潜在的锚定信号并将其转化为局部、自然语言的反馈。通过改进基础模型原生的不确定性信号,这种对潜在空间的操作实现了可靠、细粒度的检测,而无需二次推理循环的开销。通过激活修补和逐层探针进行的机理分析表明,这种秩不变行为将预先存在的不确定性几何结构重构为线性可分离的表示,其迁移可靠性优于仅使用基础模型表示。以工具调用作为细粒度幻觉的实例,我们验证了 Latent Critic 架构在基于 Qwen 和 Llama 的模型上的检测和下游改进效果。我们的方法展示了卓越的实时效能,在隔离幻觉方面显著优于同等规模的微调外部检测器、语义熵基线和被动内部探针,实现了 0.966 的 AUROC 和超过 80% 的定位准确率(例如,无依据的日期)。当部署在闭环 ReAct 环境中时,Critic 充当可忽略延迟的护栏,在执行前拦截幻觉以防止非期望动作,同时利用这一具体的局部反馈实现高效的智能体自我纠正。
查看缓存全文
缓存时间: 2026/08/12 08:29
# 可操作的幻觉检测:将潜在不确定性转化为智能体批评
来源:https://arxiv.org/html/2608.10430
###### 摘要
作为 AI 智能体部署的大语言模型 \(LLMs\) 经常出现用户规范锚定失败,即执行幻觉性的、非用户期望的动作来强行推进结果,而非表达不确定性。现有检测方法要么无法定位幻觉,要么产生过高的推理延迟,因而无法提供可操作的实时修正。我们引入了 Latent Critic,一个轻量级低秩适配器 \(LoRA\),它与冻结的基础 LLM 生成过程并发运行,主动重构 Transformer 的残差流——放大潜在的锚定信号,并在同一个序列内将其转化为局部化的自然语言反馈。通过精炼基础模型自身的不确定性信号,这种对潜在空间的操控能够在不引入二次推理循环开销的情况下,实现可靠且细粒度的检测。通过激活修补和逐层探针进行的机制分析表明,这种秩不变行为将预先存在的不确定性几何结构重构为线性可分的表示,其迁移可靠性高于单独使用基础模型表示。我们以工具调用作为细粒度幻觉的实例,在 Qwen 和 Llama 系列模型上验证了 Latent Critic 架构带来的检测能力和下游改进。我们的方法展现出优越的实时效能,在隔离幻觉方面显著优于同等规模的微调外部检测器、语义熵基线和被动内部探针,实现了 0.966 AUROC 以及 >80% 的定位准确率(例如 `ungrounded: date`)。当部署在闭环 ReAct 环境中时,Critic 充当一个几乎零延迟的护栏,在执行前拦截幻觉以防止非期望动作,同时利用这一具体且局部化的反馈,实现高效的智能体自我纠正。
## 1 引言
人类交流本质上充满省略和歧义。当 AI 智能体遇到不完整的指令时,最优行为是暂停执行、表达不确定性并寻求澄清(Vijayvargiya 等人,2026b(https://arxiv.org/html/2608.10430#bib.bib1);Kim 等人,2024(https://arxiv.org/html/2608.10430#bib.bib2))。然而,大语言模型 \(LLMs\) 高度优化了指令遵循和下一 token 预测,这使它们产生了严重的任务完成偏向(Bai 等人,2022(https://arxiv.org/html/2608.10430#bib.bib3))。在智能体工作流中,这种偏向以用户规范锚定失败的形式体现出一种关键失效模式(Sun 等人,2025(https://arxiv.org/html/2608.10430#bib.bib5))。与标准的事实性幻觉不同,一个动作可能在逻辑上合理,但如果它从未被用户显式或隐式地请求,它仍然是幻觉。模型不会标记缺失的规范,而是自信地执行这些非期望动作,从而对环境造成具体且不一致的改变。这种对模糊输入缺乏适应性的问题,限制了 AI 智能体在高风险场景中部署的可靠性。
当前的检测范式无法满足实时智能体对延迟、可操作性和泛化性的要求。微调的外部 LLM 作为评判者的评估器(Darwish 等人,2025(https://arxiv.org/html/2608.10430#bib.bib7))以及多种采样技术(如语义熵(Ji 等人,2023(https://arxiv.org/html/2608.10430#bib.bib6);Kossen 等人,2024(https://arxiv.org/html/2608.10430#bib.bib18)))都基于表层文本运作,会引入过高的推理延迟。此外,由于模型会自信地生成这些动作,基于不确定性的采样方法对这些错误往往产生低熵,导致检测失效。相比之下,探针技术表明,模型的内部表示编码了其自身不确定性的信号(Orgad 等人,2025(https://arxiv.org/html/2608.10430#bib.bib44))。然而,被动探针通常训练逐层分类器,产生标量置信度分数,缺少调试动作所需的可操作定位信息。
参见图注 图 1:闭环智能体架构。当冻结的基础模型生成幻觉参数时,Latent Critic 并发地提取规范锚定失败,阻止执行,并将局部化错误作为零样本环境观察反馈回去。
这一可操作性的缺口引出了一个基本问题:我们能否在不高额延迟的情况下,将内部不确定性转化为局部化反馈?为回答这一问题,我们引入了 Latent Critic,一种参数高效微调 \(PEFT\) 架构,旨在充当一个极低延迟的机制性护栏。我们将设计和研究范围具体限定在工具调用。与开放式文本生成(其中幻觉的边界往往模糊且主观)不同,工具调用是可执行的动作,需要精确的参数级规范锚定。工具调用的结构化领域为隔离锚定错误和评估细粒度不确定性提取提供了理想的测试平台。通过将专用的 LoRA 适配器附加到冻结的基础模型上,我们保留了其原生智能体能力,同时利用 LLM 主干在同一个生成序列中明确说出精确的局部化幻觉(例如 `ungrounded: date`)(图 1(https://arxiv.org/html/2608.10430#S1.F1))。通过掩码诊断目标,Critic 重构了规范锚定的原生表示,将其放大为线性可分的几何结构,该结构在分布偏移下的迁移可靠性优于被动探针。通过将检测机制直接嵌入生成过程,Latent Critic 弥合了机制表示与实际智能体安全之间的鸿沟。
我们在 Qwen 和 Llama 系列模型上评估该架构,证明暴露并重构这种潜在几何结构能够提供一种高度可靠、极低延迟的护栏,它在分布偏移下仍然是最强的检测器,并能实现高效的智能体自我纠正。我们围绕三个核心研究问题 \(RQs\) 组织研究:
- • RQ1(检测):修改残差流能否带来更优的幻觉定位?
- • RQ2(机制):适配器如何重构模型的内部几何结构,以将不确定性转化为可操作的反馈?
- • RQ3(部署):智能体能否利用这种具体、局部化的反馈进行零样本自我纠正,从而缓解安全性与生产力之间的权衡?
## 2 实验设置
为了严格评估实时幻觉检测,我们将规范锚定失败与一般能力错误区分开来,并建立一种大规模生成和标注工具调用轨迹的方法。
### 2.1 定义工具调用幻觉
在智能体工具调用的范围内,我们评估三种主要行为结果:
\(1\) 正确且已锚定 \(ok\):正确的工具被调用,且所有参数都锚定在上下文历史中。
\(2\) 错误工具 \(wrong\_tool\):调用了不适合用户目标的工具(策略错误)。
\(3\) 未锚定参数 \(ungrounded\):调用了正确的工具,但模型凭空生成了从未在上下文中指定的参数(规范锚定错误)。
我们明确排除能力限制,例如省略参数(在我们的经验 rollout 中占比 <<0.2%)和语法错误。举例说明后者:如果用户请求在“明天”执行某个动作,而智能体生成了字面字符串 `"tomorrow"`,而不是所需的模式格式(例如 `"YYYY-MM-DD"`),那么模型拥有正确的上下文锚定,但缺乏结构合规性。关键在于,我们对该领域中幻觉的定义完全聚焦于用户对话上下文中是否缺乏支持。与依据外部基准真相进行评估的事实性幻觉不同,规范锚定是严格依据对话历史来评估的。一个生成的参数可能看起来非常合理甚至事实正确(例如猜出一个有效日期或常用设置),但只要用户从未显式或隐式地提供它,它仍然是幻觉。
### 2.2 轨迹生成
为了生成具有自然歧义特征的数据,我们构建了一个动态环境,其中包含一个基础智能体和一个模拟用户(Patil 等人,2025(https://arxiv.org/html/2608.10430#bib.bib46);Suri 等人,2026(https://arxiv.org/html/2608.10430#bib.bib9))。
数据集:许多工具调用基准要么使用简化模式,无法在规模上引发幻觉,要么使用多跳任务,对被测模型来说过于复杂。为可靠地触发幻觉,我们从 SLM 智能体文献中选取基础场景(Vijayvargiya 和 Lokesh,2025(https://arxiv.org/html/2608.10430#bib.bib10)),提供易处理的用户意图和高度详细的工具模式。我们使用 5,000 个场景进行训练,并使用一组包含未见工具的 500 个任务进行评估(ID)。我们还使用了 ToolAlpaca 中的 200 个场景(Tang 等人,2023(https://arxiv.org/html/2608.10430#bib.bib12))——该数据集包含覆盖 50 个不同类别的真实世界 API——以评估对分布外 \(OOD\) 任务的泛化能力。生成的工具调用包含从单个 token 到多个句子的不同长度值,以评估 Critic 的鲁棒性,而键值结构则允许生成精确的定位标签。
模拟用户与二进制掩码:由 Qwen3.5-122B 驱动(Qwen 团队,2026(https://arxiv.org/html/2608.10430#bib.bib8)),用户通过结构多变、模糊的请求逐步揭示一个底层目标。为了以编程方式追踪这一点,用户维护一个隐藏的已完成规范列表 \(CSL\)——一个覆盖基准真实工具调用的二进制掩码,用于追踪 GT 工具调用中某个参数所需信息是否已被提供(1)或保留(0)。举例说明,考虑一个 GT 目标为 `{"name": "book_flight", "args": {"from": "Melbourne", "to": "Sydney", "date": "2027-03-26"}}`。如果用户第一轮说“我想飞到悉尼”,CSL 掩码初始化为 `{"from": 0, "to": 1, "date": 0}`。如果智能体随后询问出发城市,用户回答“墨尔本”,掩码在第二轮更新为 `{"from": 1, "to": 1, "date": 0}`。在智能体的回合中,如果它输出的工具调用中某个参数对应 0,则该生成被标记为未锚定幻觉。完全不在底层目标中的工具则被标记为 `wrong_tool`。模拟用户在每一轮逐步更新 CSL,基于 Qwen 3.5 122B 模型的初始程序化标签与人工评估的一致性率达到 89%。由于我们研究的是规范锚定——即对话中是否存在信息——而非对话自然度,模拟用户提供了受控、平衡的交互,而这些交互若用真人受试者进行规模化收集在后勤上是不现实的(Vijayvargiya 等人,2026b(https://arxiv.org/html/2608.10430#bib.bib1);Suri 等人,2026(https://arxiv.org/html/2608.10430#bib.bib9))。为确保严谨的基准测试,所有评估轨迹(ID 和 OOD)都经过人工标注者验证,所有报告的指标都使用这些经过修正和人工验证的标签。程序化管线中的失败案例主要包括模拟器模型在隐式规范追踪或格式化方面的错误。
该管线避免了训练集上昂贵的人工标注,能够可靠扩展,并能准确定位确切的幻觉参数。我们使用该管线,在 Qwen3-4B 和 Llama-xLAM-2-8B 上执行 rollout(Zhang 等人,2024(https://arxiv.org/html/2608.10430#bib.bib11)),以确保我们的范式能跨不同架构泛化。
## 3 RQ1:通过 Latent Critic 实现可操作的幻觉检测
现有的内部探针技术产生被动的标量输出,缺乏智能体自我纠正所需的言语化定位信息。为回答 RQ1,我们引入了 Latent Critic,其设计目标是并发提取内部不确定性,并输出幻觉的精确语义位置(例如具体键名)。
### 3.1 Latent Critic 架构
检测模块由一个低秩适应 \(LoRA\) 模块组成(Hu 等人,2021(https://arxiv.org/html/2608.10430#bib.bib13)),它通过多适配器服务与冻结的基础智能体并发执行。由于适配器的权重初始化为零,其初始前向传播与基础模型的确切隐藏状态一致。在智能体循环中,冻结的基础模型自回归地生成工具调用语法。与此同时,适配器接收相同的输入 token,但学习修改隐藏状态并放大不确定性信号,而此阶段其输出被忽略(图 2(https://arxiv.org/html/2608.10430#S3.F2))。工具调用完成后,追加一个触发 token(`[POS]`),充当一个局部化的注意力汇聚点。该 token 建立了一个结构边界,提示 Critic 现在必须通过聚合来自完整工具调用上下文的不确定性,并生成结构化分类(例如 `ok`、`wrong_tool` 或 `ungrounded: [parameter_name]`)来言语化检测结果。
为确保适配器严格充当不确定性提取器,我们修改了监督微调 \(SFT\) 目标。在损失计算期间,基础工具调用生成部分被掩码掉,梯度仅在 `[POS]` token 及其后标签上计算。需要注意的是,在推理时,适配器在基础模型生成工具调用的同时主动处理输入,但此阶段的输出被忽略。这从暂停 token 中汲取了灵感(Goyal 等人,2024(https://arxiv.org/html/2608.10430#bib.bib15))。不过,先前工作利用虚拟 token 在文本生成期间注入额外的计算步骤,而 Critic 在基础模型工具调用生成期间产生的步骤则允许进行不确定性累积。
参见图注 图 2:并发提取架构。适配器在工具调用生成期间处理基础模型的隐藏状态,并在生成 `[POS]` token 时将累积的不确定性投影出来。
表 1:Qwen3-4B 上的幻觉检测性能。正类 = `ungrounded`。Critic 和 Judge 在完整三分类集合上以一对其余方式进行评估(ID N=303:ok 41.6%,ug 35.0%,wt 23.4%;OOD N=522:ok 76.2%,ug 20.7%,wt 3.1%)。Probe 和 Entropy 系列仅在二分类 ok-vs-ungrounded 子集上评估。±\pm 表示 10,000 次 bootstrap 重采样上的一个标准差。Latent Critic 在所有阈值无关指标上均达到峰值性能。
表 2:在 Llama-xLAM-2-8B 上的跨模型复现。正类 = `ungrounded`。相对于被动探针的优势强烈复现,而相对于外部评估器的优势在分布偏移下呈现模型相关性。
### 3.2 结果
我们在 Qwen3-4B 和 Llama-xLAM-2-8B 上,将 Critic 与同等规模的外部 Judge(Qwen 3.5 4B)、基于基础模型最优层训练的被动内部线性探针,以及多种基于不确定性的基线(Token Entropy、Semantic Entropy 和 SEP)进行比较。外部 Judge 和线性探针使用与 Critic 相同的数据进行训练,其中 Judge 使用与 Critic 完全相同的配置(LoRA 秩、输入提示、标签等),而探针和熵相似文章
AI代理中的操作幻觉与安全漂移
本文识别并描述了基于LLM的自主代理中的两种故障模式——安全漂移和操作幻觉——并提出了一种轻量级架构层,可在无假阳性情况下拦截违规行为。
幻觉即利用:携带证据的多模态智能体
本文形式化了多模态智能体中的幻觉到动作转换,并提出了携带证据的智能体(ECA),它使用受限验证器仅授权安全的工具调用,在200个任务的流水线上实现了0%的不安全动作率。
RAGognizer:通过检测头集成实现幻觉感知微调
RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。
将幻觉视为异常:通过概率电路进行动态干预
本文提出了 PCNet,这是一种在大型语言模型(LLM)残差流上训练为可计算密度估计器的概率电路,用于将幻觉检测为几何异常。同时,本文还引入了 PC-LDCD,一种仅在生成幻觉 token 时才进行干预的动态修正方法,实现了近乎完美的检测率并降低了错误修正率。
基于开权重代理分析器激活的幻觉检测
本文介绍了一种代理分析器框架,通过分析小型开权重模型的内部激活状态而非生成模型本身,来检测大型语言模型中的幻觉。与 ReDeEP 等现有方法相比,该方法在 RAGTruth 等基准测试中表现出更优越的性能,证明了分析方法的优劣比模型大小更为关键。