AURA: 情境化LLM智能体中隐式需求的意图导向探询
摘要
AURA 引入了一个意图导向的探询步骤,使LLM智能体能够浮现情境化查询背后的隐式用户需求,在基准测试上提高了覆盖率,同时减少了不必要的工具调用并防止了隐私侵犯。
arXiv:2606.05557v1 公告类型:新
摘要:情境化查询如“Lin Wei在哪里?”通常编码了比字面内容更多的信息:用户可能还想知道Lin Wei是否有空、心情如何、或者现在是否值得打扰。标准工具使用智能体只回答字面问题然后停止。AURA在场景感知和工具使用之间插入一个推理步骤,生成IntentFrame:一种对隐式需求的结构化估计,带有一个标量差距分数,用于控制每次查询的探询预算和工具选择。在一个包含100个查询、四个场景的隐式意图基准测试上,AURA相比ReAct风格的探询提高了隐式需求覆盖率(Delta = +0.07,p < 10^-6);四个场景中有三个具有独立显著性,该增益在第二个骨干网络上复现,提示消融实验将提升归因于差距校准而非答案记忆。在事实查找中,控制器以原始准确率为代价,减少了82%的探询次数,并在一个隐私敏感的数据切片上实现了零违规工具调用;适用范围条件详见局限性部分。代码、模拟器和基准测试已在 https://github.com/innovation64/AURA 发布。
查看缓存全文
缓存时间: 2026/06/05 08:06
# 面向意图的探针:情境化LLM代理中的隐式需求揭示 来源:https://arxiv.org/html/2606.05557 杨李 刘嘉祥 蒋蔡 徐明坤 广东智能科学与技术研究院 \{liyang, liujiaxiang, caijiang, xumingkun\}@gdiist\.cn ###### 摘要 像“林伟在哪里?”这样的情境化查询通常编码了超越其字面内容的信息:用户可能还想知道林伟是否空闲、心情好不好,或者现在是否值得打扰他。标准的工具使用代理会回答字面问题并就此打住。AURA在场景感知和工具使用之间插入了一个推理步骤,该步骤生成一个IntentFrame:对隐式需求的结构化估计,带有一个标量*gap*分数,该分数控制每次查询的探针预算和工具选择。在一个包含100个查询、四个场景的隐式意图基准测试上,AURA在隐式需求覆盖率上优于ReAct风格的探针(Δ=+0.07,p<10^{-6});四个场景中有三个具有统计显著性,该增益在第二个骨干网络上得以复现,且一次提示消融实验将提升归因于差距校准而非答案记忆。在事实查找方面,控制器在隐私敏感片段上以原始准确率换取82%更少的探针和零次禁用工具违规;范围条件在局限性部分详述。代码、模拟器和基准测试已在https://github.com/innovation64/AURA开源。
# AURA:情境化LLM代理中的面向意图探针用于隐式需求揭示 杨李 刘嘉祥 蒋蔡 徐明坤††致谢通讯作者。广东智能科学与技术研究院 \{liyang, liujiaxiang, caijiang, xumingkun\}@gdiist\.cn
## 1 引言 基于LLM的代理(Xie等人,2025;Wang等人,2023a)已被部署于社会模拟(Park等人,2023)和软件团队(Hong等人,2024)中,但它们常常回答用户关于环境的*字面*问题,却遗漏了其背后的*隐式*信息需求。询问“林伟在哪里?”可能是一个位置请求,但也可能意味着“她现在有空聊天吗?”。这带来了三个下游问题:代理会在信息不完整的情况下做出决策;面向用户的响应会编造细节而非基于当前状态;环境状态很少被转化为用户下一步行动所需的具体上下文。
先前的方法只能部分解决这个问题。ReAct(Yao等人,2023)在答案生成过程中交织推理和工具调用,但工具仅在表面查询明确要求它们时才会触发——这个循环中没有一步是询问“用户实际上想知道什么?”。Plan-and-Solve(Wang等人,2023b)根据字面查询预先规划工具调用,没有任何机制能够桥接到字面查询未提及的隐式需求。生成式代理(Park等人,2023)将所有环境状态注入为被动上下文,但无法控制对给定查询应揭示哪些私有状态。每种方法都将用户的表面查询视作其字面形式完全指定了用户想要的内容。
AURA的贡献是补上缺失的一步:将隐式需求推理作为工具使用的*独立控制变量*。与将另一个LLM调用附加到ReAct循环中不同,AURA将差距估计分解为工具前的路由决策,该决策决定发出哪些私有状态探针以及发出多少个。通过*situated*,我们指的是结构化环境,其中私有状态被分区在工具中介的访问之后——代理可以被动地观察公共上下文,但必须主动探针以获取隐藏状态。这比通用的“situated agent”范畴更窄,后者包括具身导航、开放世界探索和实时传感器融合;我们不涉及那些设置。我们将此问题作为结构化环境状态上的隐式意图推理进行研究。
AURA引入了Environment Agent:一个流水线(Perceive→Scene→Memory→Reason),加上一个LLM生成的IntentFrame,该框架估计用户字面查询与合理隐式需求之间的差距,然后使用该估计来指导每次查询的探针、工具选择以及可选的预警提示。
**贡献。** (i) 我们引入IntentFrame作为一个*工具前的控制变量*:在任何工具触发之前,代理推断用户的隐式需求并发出一个标量差距分数,该分数确定探针预算并初选候选工具。(ii) 在一个包含100个查询、四个场景的隐式意图基准测试上,差距路由的探针在隐式需求覆盖率上优于ReAct风格的无意图探针(Δ=+0.07,p<10^{-6};四个场景中有三个显著),并在25个查询的试点、第二个骨干网络以及不相交样本消融实验中复现。(iii) 我们表征了该机制的机制边界:控制器在事实基础上是一个访问-成本帕累托点,而非一个普遍的准确性提升(第5.1节;局限性)。(iv) 我们发布了AURATown模拟器、全部100个带有子类别标签(κ=0.61标注者间一致性)的隐式意图查询,以及每个种子运行的记录。
## 2 相关工作
#### 代理架构与工具使用。
ReAct、Reflexion、Toolformer、AgentBench、ToolLLM、T-Eval(Yao等人,2023;Shinn等人,2023;Schick等人,2023;Liu等人,2024;Qin等人,2024;Chen等人,2024b)将工具使用视为反应式的:工具在*推理过程中*触发。AURA的Explore则在*推理之前*运行,并具有根据推断出的字面vs.隐式差距路由的有界预算。Plan-and-Solve(Wang等人,2023b)根据表面查询规划工具调用,但没有那种差距路由。
#### 多代理模拟与记忆。
生成式代理(Park等人,2023)将环境观察注入LLM提示中;AURA增加了 (i) 由LLM生成的IntentFrame进行的每次查询访问*控制*,与被动top-k检索相对;以及 (ii) 一个公共/私有状态划分,它为隐式意图和信念状态评估提供了基础,而Park的全公共状态无法做到这一点。SOTOPIA(Zhou等人,2024)提供了我们采用的7维度框架;更广泛的多代理基准(Zhou等人,2024;Zhu等人,2025;Xu等人,2024;Vezhnevets等人,2023;Chen等人,2024a;Li等人,2023;Hong等人,2024)将环境视为按请求服务代理。记忆框架(Packer等人,2023;Zhong等人,2024;Lewis等人,2020;Gao等人,2023;Li等人,2026)针对长期存储;AURA的记忆由主动探针填充,而非被动积累。主动上下文代理(ContextAgent、ProAgent、PROBE、ProAgentBench (Yang等人,2026,2025;Pasternak等人,2025;Tang等人,2026);完整比较见附录A7)针对*何时辅助*;并行的工业工作(Thinking Machines Lab,2026)主张将交互性视为一种原生多模态能力,具有连续的微观轮次感知而非轮次绑定的提示;AURA与这两个轴正交,目标是针对*已接收到的查询*应揭示*哪些私有状态上下文*。
#### 语用与条件式QA。
另一并行工作线在纯文本QA中针对相同的动机:用户省略了他们假设模型已共享的上下文。Li等人(2025)引入了CondAmbigQA,一个包含2,000个查询、具有条件感知推理的基准,将QA准确率提高了11.75%。AURA在不同的机制中解决相同的差距:隐式需求存在于另一个代理的隐藏私有状态中而非文本上下文中,解决机制是对结构化环境注册的有预算探针,而非文本条件重写。
#### 信念状态评估。
LLM中的心智理论存在争议:Kosinski (2023) 主张自发涌现;Sap等人(2022);Ullman (2023) 显示在微小改动的Sally-Anne任务上失败;Sclar等人(2023) 构建了一个显式符号追踪器。AURA*不是*一个ToM基准:在我们的五个隐式意图子类别中,只有*second_order*是探针信念追踪(源自Ullman (2023) 的过时信念模板);其他四个 (*availability、mood、appropriateness、latent_goal*) 的目标是通过一个有预算的控制器揭示非信念的私有状态。我们将AURA定位为关于*意图导向的探针何时有助于揭示隐藏状态*的证据;信念查询作为五种底物之一 (*second_order*) 出现在我们的5子类别分类中。向外部信念基准的迁移并非自动成立:附录A20报告了一个FANToM迁移的零结果。
## 3 AURA框架
AURA将情境化代理分解为两个阶段(图1):*确定性上下文组装*(Sense→Scene→Memory)随后是*LLM控制的推理*(IntentInferrer→Explore→Reason→Act→Interact)。确定性阶段使用与生成式代理(Park等人,2023)相同的被动感知模式建立被动上下文预览,并非贡献所在。贡献在于IntentInferrer,它生成一个IntentFrame,其标量差距字段控制Explore中的每次查询探针预算和工具选择(第3.3节);Reason、Act和Interact随后规划并发出响应,当推理器的差距值超过阈值时可选的预警提示。本节剩余部分形式化了问题(第3.1节),描述有界探针循环(第3.2节),并详述IntentFrame阶段(第3.3节)。
(图1:AURA流水线。Sense接收用户查询;Scene和Memory组装一个确定性上下文预览。IntentInferrer (⋆) 输出一个IntentFrame,其标量gap字段路由Explore中的探针预算和工具选择(第3.3节)。Reason在丰富的上下文上规划;Act和Interact发出响应。)
### 3.1 问题形式化与架构
我们考虑一个情境化多代理系统,其中有N个代理在一个共享环境E中于离散时间步操作。一个人体用户h可能通过自然语言查询q与任何代理交互。我们寻求最大化代理行为和面向用户响应的*环境接地性*:
max_{π_E} E[ Σ_t G(α_i^t, E^t) + Σ_q R(r_q, E_{q}^t) ],
其中G衡量动作-状态一致性,R衡量响应事实准确性,π_E是Environment Agent的探针策略。Explore阶段的有效范围受限于被动感知后的剩余不确定性:当Sense/Scene/Memory覆盖了查询所需的事实时,额外探针收效甚微;当查询依赖于远程代理的私有状态时,一次目标明确的探针就能改变答案。
### 3.2 有界主动探针
Explore阶段实现有界环境探针。与ReAct(Yao等人,2023)中工具调用在*推理过程中*交错不同,我们的探针发生在*答案生成之前*,因此最终响应以紧凑的探针轨迹为条件。探针循环迭代最多B个步骤;在每一步,LLM规划器φ检查当前上下文和工具注册表T={t_1,...,t_K},要么发出一个工具调用(其结果被附加到探针轨迹并用于更新上下文),要么发出停止信号;轨迹在结束时被总结并由Reason消费。伪代码在算法1(附录A1)中。
**设计。** 该循环是目标导向的(由LLM驱动的工具选择,基于当前上下文,而非穷举)、有界的(步骤预算B限制了API成本)、可组合的(每个工具结果更新上下文用于下一步决策,实现多跳信息收集),且可分离的(探针独立于推理运行,因此结果可以被缓存或跳过)。AURATown实例化为事实接地性基准注册了八个基础环境工具(表8,附录A5),并为隐式意图基准注册了一个独立的包含五个工具脚本的代理状态探针注册表(第5.2节);两者都在一个基于模式的允许/拒绝策略下注册。
### 3.3 意图推理:对用户隐式需求建模
主动探针决定*向环境询问什么*;意图推理估计*用户可能需要什么有用的答案*。AURA将第二个决策分解为一个显式的LLM中介阶段,位于Scene/Memory和Explore预算选择器之间。给定用户的表面查询q、预览场景S和近期记忆M,IntentInferrer产生一个IntentFrame:
IntentFrame = (ℓ, I, g ∈ [0,1], P ⊆ T, a ∈ {0,1}, c ∈ [0,1], r)
其中ℓ是字面需求的重述,I是合理隐式需求的列表,g是字面需求与隐式需求之间的*差距*(如果字面答案足够则为0,如果用户的真实需求是完全正交的则为1),P是从注册表T中选出的推荐探针工具集,a是警报标志,c是推理器自报告的置信度,r是理由。差距g是控制输入:下游阶段使用一个确定性映射B(g)=0,1,2,3,5,分别对应g∈[0,0.2),[0.2, 0.4),[0.4, 0.6),[0.6, 0.8),[0.8, 1],并由全局explore_max_steps预算截断。重要的是,B(g)是一个*上限*,而非一个目标:下游的Explore循环同时接收探针预算和recommended_probes提示,我们在附录A2.1节中观察到这个提示对最终探针步骤数有很强的影响。相似文章
LLM匿名化对抗代理性重新识别
AURA是一个基于LLM的匿名化框架,通过自适应隐私范围和mask-reconstruct方法在保护隐私以抵抗代理性网络搜索重新识别的同时,保持上下文效用,从而平衡隐私保护与效用保持。
面向LLM Agent澄清请求的不确定性分解
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。
三思而后行:LLM 智能体的自主探索
本文指出自主探索是大语言模型智能体的关键能力,并提出了先探索后行动范式,该范式将信息收集与任务执行解耦,以提升适应性和实际性能。同时引入了探索检查点覆盖率作为可验证的指标,用于评估探索的广度。
PrivacyPeek:审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么
介绍了PrivacyPeek,一个用于审计基于LLM的智能体在获取阶段隐私泄漏的基准,表明智能体经常收集超出必要范围的敏感数据,且现有防御措施不足。
AGORA: 基于适配器的观测-动作保留——用于LLM代理的无推理提示压缩
AGORA 引入了一种用于LLM代理的无推理步骤级提示压缩器,避免了令牌级压缩器的'动作语法破坏'失效模式。它通过结构解析器、始终保留底限以及学习的相关性评分器,在9个环境中的8个(跨骨干网络)保留了≥75%的未压缩性能。