通过不确定性对齐的强化学习探索智能体工具调用决策

arXiv cs.AI 论文

摘要

本文提出TRUST方法,将不确定性量化融入强化学习奖励设计,以改进LLM智能体的工具调用决策,提升决策质量并保持可靠的不确定性估计。

arXiv:2606.06976v1 公告类型:新 摘要:基于大语言模型(LLM)的智能体常常做出次优的工具使用决策,包括不受支持的工具调用和幻觉式直接响应,这些错误可能在多步交互中累积。现有方法主要通过推理时修正或基于决策结果和结构化清单的粗粒度奖励信号来改进这些行为,而忽略了智能体决策的不确定性特征。我们观察到,面向决策的强化学习倾向于削弱正确与错误动作之间的不确定性分离,导致过度自信的错误和较弱的探索信号。因此,我们提出TRUST,该方法将不确定性量化作为维持不确定性分离的排斥力融入奖励设计,并为多轮轨迹的统一后训练标注轻量级关键轮次标注。在多种工具使用基准上的实验结果表明,TRUST在优化过程中一致地提升了决策质量和智能体性能,同时保持了更可靠的不确定性估计。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:14

# 通过不确定性对齐的强化学习探索智能体工具调用决策  
来源:https://arxiv.org/html/2606.06976  

Yijin Zhou¹˒²˒³,Linqian Zeng¹,Xiaoya Lu¹˒²,Wenyuan Xie¹,Dongrui Liu²˒†,Junchi Yan¹˒³,Jing Shao²˒†  
¹上海交通大学,中国  
²上海人工智能实验室,中国  
³上海创新研究院,中国  

###### 摘要  

基于大型语言模型(LLM)的智能体往往在工具调用决策上表现不佳,包括调用不支持的工具以及产生幻觉式的直接响应,这些错误在多步交互中可能累积并导致更多问题。现有方法主要通过推理时的纠正或基于决策结果和结构化检查表的粗粒度奖励信号来改善这些行为,但对智能体决策的不确定性特征探索不足。我们观察到,面向决策的强化学习往往会削弱正确与错误行为之间的不确定性分离,导致过度自信的错误和较弱的探索信号。为此,我们提出 **TRUST**,该方法将不确定性量化作为排斥力引入奖励设计,以维持不确定性分离,并标注轻量级的关键回合决策点,用于对多轮轨迹进行统一后训练。在多种工具调用基准测试上的实验结果表明,**TRUST** 在优化过程中能够持续提升决策质量和智能体性能,同时保持更可靠的不确定性估计。  
代码:https://github.com/yjzscode/TRUST  

## 1 引言  

基于大型语言模型(LLM)的智能体通过调用外部工具进行知识检索、计算以及与真实世界环境交互,扩展了语言模型的能力 [Yao et al., 2023 (https://arxiv.org/html/2606.06976#bib.bib1); Schick et al., 2023 (https://arxiv.org/html/2606.06976#bib.bib2); Qin et al., 2024 (https://arxiv.org/html/2606.06976#bib.bib3); Lu et al., 2026a (https://arxiv.org/html/2606.06976#bib.bib39); Chen et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib41)]。然而,智能体在特定动作回合中经常出现工具调用决策失败,例如在工具使用不支持或不必要时调用工具,或者在需要工具调用时编造直接回答 [Ross et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib4); Healy et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib30); Zhou et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib38)]。与LLM中传统的文本幻觉不同,工具调用决策失败会破坏中间状态,并在后续交互轮次中传播错误,从而在实际智能体任务中导致财务成本、执行失败和信息泄露 [Lin et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib31); Su et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib32); Zhang et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib33); Lu et al., 2026b (https://arxiv.org/html/2606.06976#bib.bib37)]。  

请参考图注  
**图 1**:工具调用决策失败(错误决策且低不确定性)与我们的 **TRUST** 解决方案之间的比较。  

最近的研究通过提取推理过程中的内部不确定性信号或结构化推理模式来解决工具调用决策失败问题 [Zhang et al., 2026b (https://arxiv.org/html/2606.06976#bib.bib17); Stoisser et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib34)]。然而,它们主要关注推理时的后验干预,而非通过策略优化来提升智能体本身的决策能力。Ross 等人 [2025 (https://arxiv.org/html/2606.06976#bib.bib4)] 和 Suri 等人 [2025 (https://arxiv.org/html/2606.06976#bib.bib9)] 的研究尝试通过强化学习(RL)进行工具调用决策优化,通常依赖于决策分类或基于规则的检查表生成的粗粒度奖励公式。然而,这些方法缺乏对工具调用决策优化背后策略探索动态的定量分析,仍有很大的改进空间。  

从模型响应的不确定性量化(UQ)角度来看,我们观察到现有的基于 RL 的工具调用决策优化方法往往倾向于提高已采样高奖励动作的置信度,同时无意中削弱了正确与错误决策之间的不确定性分离。如图 1 (https://arxiv.org/html/2606.06976#S1.F1)(a) 所示,经过面向决策的 RL 优化后,不支持的工具调用和不合理的直接回答越来越多地与低不确定性区域重叠,从而破坏了模型原有的校准能力——较高的不确定性应表明决策错误的可能性更大。以 Qwen3-4B-Thinking [Yang et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib23)] 为例,在针对工具调用决策进行 RL 优化后,“错误决策但低不确定性”的比例从 34.50% 上升到 70.21%。这一观察结果表明,现有的面向决策的目标优化主要优化动作的正确性,而没有保留这些决策背后的不确定性结构。因此,过度自信但错误的动作获得的优化压力有限,导致策略难以向更可靠的替代方案探索。  

为了解决这个问题,我们提出了 **工具调用决策奖励与不确定性分离后训练(TRUST)**,该框架将 UQ 作为排斥力融入奖励之中,而不仅仅将其作为后验诊断信号。具体来说,我们引入了一个 UQ 对齐的奖励,该奖励联合建模动作正确性以及由负例决策与真实决策之间的不确定性差距导出的确定性裕度。如图 1 (https://arxiv.org/html/2606.06976#S1.F1)(b) 所示,我们的奖励鼓励模型将较低的不确定性分配给正确决策,同时为错误或反事实决策保持相对较高的不确定性。这种机制促进了远离不确定或不可靠决策的探索,并为策略更新提供了更强的优化信号。  

此外,我们将这种训练范式从独立决策实例扩展到多轮智能体轨迹。我们不是对整个轨迹进行详尽的重标注,而是为轻量级的关键决策回合标注,从而实现从轨迹级任务成功到回合级工具调用校准的统一后训练。轨迹级结果奖励监督整体任务完成情况和工具执行质量,而我们的回合级 UQ 对齐奖励则明确校准工具调用的时机和适当性。  

实验表明,**TRUST** 在多种工具使用基准测试上取得了显著改进,同时保留了智能体决策的不确定性结构。在回合级工具调用决策优化方面,**TRUST** 在 When2Call 任务上的准确率提升了超过 11%,同时在复杂的多轮交互和工具使用轨迹上的性能也得到加强。与轨迹级工具调用后训练相结合,**TRUST** 在 BFCL-V4 上的性能提升了 6.33%,在 ToolSandbox 上提升了 7.07%。这种提升在具有挑战性的决策密集型场景中尤为明显,包括 BFCL-V4 上的多轮和无关性任务,以及 ToolSandbox 中的多用户回合和干扰工具等场景。总体而言,**TRUST** 共同优化了工具的整体执行质量和回合级工具使用的适当性,为策略学习提供了更强的优化信号,并使多轮智能体行为更加可靠。  

## 2 相关工作  

#### 语言智能体的不确定性量化  
UQ 已被广泛用于估计语言模型输出的可靠性 [Kadavath et al., 2022 (https://arxiv.org/html/2606.06976#bib.bib10); Lin et al., 2022 (https://arxiv.org/html/2606.06976#bib.bib11); Zhou et al., 2024 (https://arxiv.org/html/2606.06976#bib.bib40)]。早期工作主要通过模型概率、口头置信度和基于采样的一致性信号来关注输出级不确定性 [Kadavath et al., 2022 (https://arxiv.org/html/2606.06976#bib.bib10); Lin et al., 2022 (https://arxiv.org/html/2606.06976#bib.bib11); Manakul et al., 2023 (https://arxiv.org/html/2606.06976#bib.bib13); Kuhn et al., 2023 (https://arxiv.org/html/2606.06976#bib.bib12); Manakul et al., 2023 (https://arxiv.org/html/2606.06976#bib.bib13)]。最近,研究人员指出,智能体系统中的不确定性不仅涉及最终响应,还包括中间动作、环境观测和多步轨迹 [Kirchhof et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib14); Duan et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib16); Oh et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib15); Zhang et al., 2026b (https://arxiv.org/html/2606.06976#bib.bib17); Stoisser et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib34); Lymperopoulos and Sarathy, 2025 (https://arxiv.org/html/2606.06976#bib.bib36)]。一些方法进一步利用不确定性来调节智能体行为,例如在模糊指令下触发澄清、控制记忆和反思、或通过结构化奖励引导探索 [Suri et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib9); Zhang et al., 2026b (https://arxiv.org/html/2606.06976#bib.bib17), a (https://arxiv.org/html/2606.06976#bib.bib18)]。与主要将不确定性视为事后诊断或行为控制信号的先前工作不同,我们明确地将不确定性融入策略优化,并通过不确定性感知的奖励来对齐决策正确性与模型置信度。  

请参考图注  
**图 2**:**TRUST** 概述。它包含两个组成部分:(a) 回合级 UQ 对齐奖励,使用不确定性作为排斥信号,对齐决策正确性与置信度;(b) 轨迹级统一后训练框架,为关键回合增加决策标注,并将 \( R_{\text{UQ}} \) 与任务级奖励相结合,共同优化执行质量和工具调用决策。  

#### 工具调用决策学习与优化  
工具增强的 LLM 已在工具选择、参数生成和大规模 API 使用方面得到广泛研究 [Schick et al., 2023 (https://arxiv.org/html/2606.06976#bib.bib2); Qin et al., 2024 (https://arxiv.org/html/2606.06976#bib.bib3); Patil et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib20); Lu et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib19)]。除了执行正确性之外,近期工作越来越关注决策过程本身:智能体是否应在当前观察下调用工具、提出后续问题、直接回答或放弃回答。When2Call 等相关基准和分析隔离了这一决策层,并揭示了常见失败模式,包括不必要的工具调用和幻觉式的直接回答 [Ross et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib4); Wang et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib21); Wu et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib22); Sun et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib27)]。同时期的工作进一步探索了使用校准奖励或决策监督进行基于 RL 的工具调用行为优化 [Suri et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib9); Modecrua et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib28); Zhong et al., 2026 (https://arxiv.org/html/2606.06976#bib.bib29)]。与这些主要优化决策正确性的方法不同,我们的工作研究 RL 如何重塑工具调用策略的不确定性结构,并利用该结构来提升决策质量和校准能力。  

## 3 TRUST 方法  

### 3.1 问题形式化  

给定状态 \( \mathcal{S} \),下一个动作的决策是一个四分类智能体动作空间 [Ross et al., 2025 (https://arxiv.org/html/2606.06976#bib.bib4)]:  

\[
\mathcal{A} = \{ \text{Direct}, \text{Tool}, \text{Ask}, \text{Unable} \},
\]  

其中 **Direct** 表示直接回答,**Tool** 表示调用外部工具,**Ask** 表示向用户请求缺失信息,**Unable** 表示承认无法回答问题。具体地,在决策回合 \( t \),智能体状态为 \( s_t = (h_t, \mathcal{T}) \),其中 \( h_t = (o_1, a_1, ..., o_t, a_t) \) 表示观测到的轨迹,\( \mathcal{T} \) 表示带有模式描述的可选工具集合。策略 \( \pi_\theta: \mathcal{S} \rightarrow \mathcal{Z} \) 将状态映射到智能体响应,生成结构化响应 \( z_t = (a_t, y_t) \),其中 \( a_t \in \mathcal{A} \),\( y_t \in \mathcal{Y} \),\( \mathcal{Y} \) 是表层实现的集合。对于 **Tool**,\( y_t \) 是包含工具名和参数的工具调用载荷;否则,\( y_t \) 是自然语言。环境在工具执行或用户交互后更新状态。每个决策点有一个真实配对 \( z_t^\star = (a_t^\star, y_t^\star) \)。当所选动作在当前状态下不被支持时,即 \( a_t^\star \in \mathcal{A} / \{ \text{Tool} \}, a_t = \text{Tool} \) 或 \( a_t^\star = \text{Tool}, a_t = \text{Direct} \),则发生工具调用决策失败。因此,训练目标不仅是增加最终正确轨迹的概率,还要校准策略在中间决策上的表现:  

\[
\max_\theta \; \pi_\theta(a_t^\star, y_t^\star \mid s_t), \quad \min_\theta \; \pi_\theta(a_t^-, y_t^- \mid s_t)
\]  

对于不支持的或反事实的决策 \( z_t^- = (a_t^-, y_t^-) \)。在我们的实验中,该策略通过 GRPO 后训练进行优化。对于每个状态 \( s \),当前模型采样一组响应 \( \mathcal{Z}^G = \{ z_i \}_{i=1}^G \,并根据它们的相对奖励更新策略。  

### 3.2 回合级 UQ 对齐决策奖励  

直接奖励所选动作无法使智能体的不确定性得到更好的校准,如图 3 (https://arxiv.org/html/2606.06976#S3.F3) 所示。因此,我们使用 UQ 作为奖励中的排斥力,如图 2(a) (https://arxiv.org/html/2606.06976#S2.F2)(a) 所示。我们用序列困惑度 [Kuhn et al., 2023 (https://arxiv.org/html/2606.06976#bib.bib12)] 来实例化不确定性。对于给定的提示状态 \( s \) 和候选响应 \( z = (a, y) \),困惑度为:  

\[
\mathrm{PPL}_\theta(z \mid s) = \exp\left( -\frac{1}{|z|} \sum_{j=1}^{|z|} \log p_\theta(z_{(j)} \mid s) \right),
\]  

其中 \( z_{(j)} \) 是 \( z \) 中的第 \( j \) 个序列,\( p_\theta \) 计算 \( z_{(j)} \) 中 token 的平均值。对于每个决策点,我们比较真实决策与负例决策的困惑度:  

\[
m(s) = \mathbb{E}_{\mathcal{Z}^G}\left(\mathrm{PPL}_\theta(z^- \mid s)\right) - \mathbb{E}_{\mathcal{Z}^G}\left(\mathrm{PPL}_\theta(z^\star \mid s)\right),
\]  

其中 \( \mathbb{E}_{\mathcal{Z}^G}\left(\mathrm{PPL}_\theta(z^- \mid s)\right) = 1 \) 如果 \( \{ (a^*, \cdot) \in \mathcal{Z}^G \} = \emptyset \) ... (注:原文此处不完整,但根据上下文应为处理情况)  

(未完,根据提供的原文继续翻译)

相似文章

超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化

arXiv cs.CL

本文研究单轮不确定性量化方法是否能迁移到交互式LLM智能体轨迹中,在五个LLM和四个工具使用数据集上评估了白盒、黑盒和反思型评分器。结果表明迁移效果参差不齐,黑盒自洽性通常最强,并建议在轨迹层面重新验证UQ方法。

TeamTR:多智能体LLM协调的信任域微调

arXiv cs.LG

本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。