迈向更好的多轮用户交互代理:下一用户轮次不止于上下文

arXiv cs.AI 论文

摘要

本文介绍了反馈感知信用分配(Faca),通过利用下一用户轮次的反应作为局部信用信号来改进多轮工具使用语言代理,在交互式基准测试上显示出显著的性能提升。

arXiv:2608.17499v1 公告类型:新 摘要:面向用户的工具代理必须在用户目标多轮展开过程中协调对话和工具使用。然而,交互式强化学习通常将每次展开简化为一个终端奖励,为有效引导、错误和后续修复分配相同的信用。下一用户轮次不止于上下文:它还提供了关于前一个用户到用户片段的噪声化、时间局部证据。我们介绍了\textbf{F}eedback-\textbf{A}ware \textbf{C}redit \textbf{A}ssignment (\textsc{FACA}),它将每个反应与该片段对齐,推导出一个局部归一化的反应优势,并将其添加到已验证的终端结果优势中,而无需额外的批评者或展开。在与模拟器匹配的仅结果交互式GRPO控制中,可见对话、初始化、展开和优化方面,\textsc{FACA}在三个独立训练运行中,将九个领域$\tau$系列平均值分别提高了5.91和10.22个百分点,在8B和14B时。增益集中在电信领域;在8B时,随机化反应极性移除了电信增益。相同的排序在零样本Pare-Bench和Co-Gym上成立。这些结果表明,下一用户轮次的反应为改进多轮用户交互代理提供了可操作的局部信用。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:05

# 1 引言  
来源:https://arxiv.org/html/2608.17499  
面向用户多轮交互的更好代理:下一用户轮次不仅是上下文  
Yiwen Zhao1,2\* Zhihao Wen2\* Yuchen Mao2\* Mingxuan Jiang1 Yihao Hu2 Pan Wang2 Xin Zhang2 Wei Wu2  
1复旦大学 2蚂蚁国际,蚂蚁集团  
通信作者:z\.wen@antgroup\.com  

**摘要**  
面向用户的工具代理必须在用户目标的多轮展开过程中协调对话与工具使用。然而交互式强化学习通常将每次轨迹简化为终端奖励,对有效的引导、错误以及后续修复给予相同的信用分配。下一用户轮次不仅是上下文:它还为前一个用户到用户(U2U)片段提供了带噪声、时间上局部的证据。我们提出反馈感知信用分配(Feedback-Aware Credit Assignment, Faca),该方法将每个反应与该片段对齐,推导局部归一化的反应优势,并将其添加到经过验证的终端结果优势中,无需额外的评论家或轨迹。在模拟器中与仅基于结果的交互式GRPO控制组(在可见对话、初始化、轨迹生成和优化方面匹配)进行比较,Faca在8B和14B模型规模上,通过三次独立训练运行,将九个领域的τ\\tau-家族平均性能分别提升了5.91和10.22个百分点。增益集中在电信领域;在8B模型上,随机化反应极性会消除电信领域的增益。相同的排序在Pare-Bench和Co-Gym上零样本测试中同样成立。这些结果表明,下一用户反应为改进多轮用户交互代理提供了可操作的局部信用信号。  

**关键词**:LLM代理,多轮交互,强化学习,信用分配,用户模拟  

## 1 引言  
参见图例  
图1:多轮工具交互。一个用户到用户(U2U)片段包含两个相邻用户轮次之间所有代理响应、工具调用和工具结果;省略号表示交互持续进行。  
使用工具的语言代理正从单轮助手转向能够在延长对话中可靠、安全运行的面向用户的系统。旅行代理可能需要检查预订、引导获取缺失的偏好、比较选项、获得授权,然后才能修改数据库。与预先提供所有相关信息的完整任务不同,这些交互要求代理在外部环境和不断变化的约束下发现用户意图。目标可能在初始时被省略,或仅在代理引导后才被揭示,使用户成为主动参与者而非固定输入(29 (https://arxiv.org/html/2608.17499#bib.bib1); 18 (https://arxiv.org/html/2608.17499#bib.bib13); 1 (https://arxiv.org/html/2608.17499#bib.bib2))。图1 (https://arxiv.org/html/2608.17499#S1.F1)说明了这种结构。在相邻用户轮次$u_t$和$u_{t+1}$之间,代理可能产生多条消息和工具交互,然后才将控制权交还。我们将这个块称为*用户到用户(U2U)片段*。下一用户轮次可能提供信息、批准行动、拒绝提案或纠正误解。因此,成功需要在整个演进的交互过程中协调跨片段的对话、工具使用和用户决策。  

τ\\tau家族的交互基准测试揭示了这些要求(29 (https://arxiv.org/html/2608.17499#bib.bib1); 1 (https://arxiv.org/html/2608.17499#bib.bib2); 23 (https://arxiv.org/html/2608.17499#bib.bib10))。诸如MUA-RL和UserRL等训练框架更进一步,将LLM模拟用户置于强化学习轨迹内(35 (https://arxiv.org/html/2608.17499#bib.bib11); 19 (https://arxiv.org/html/2608.17499#bib.bib14))。这种转变使策略能够探索完整对话,同时最终的数据库或世界状态提供客观的成功监督。仅基于结果的信用分配适用于许多有效轨迹,但会压缩其内部结构:有效的引导、错误和后续修复获得相同的优势。奖励说明了轨迹*是否*成功,但未说明其在*何处*改变了方向。  

我们的核心观察是:下一用户轮次不仅是上下文。前瞻性地,它指导下一个决策;回顾性地,它为前一个U2U片段提供了局部证据。提供所请求的信息可以表明有效的引导;质疑或澄清可以暴露摩擦。这些上下文相关的反应并非正确性标签,但仅基于结果的训练未使用它们。这个过程证据能否在改善局部信用的同时,将经过验证的任务完成作为结果目标?  

我们提出反馈感知信用分配(Feedback-Aware Credit Assignment, Faca)。**Faca将每个下一用户反应与前一个U2U片段对齐,在局部轨迹组内对反应进行归一化,并将由此产生的过程优势添加到终端结果优势中**。它只改变信用分配:Faca和匹配的仅基于结果的交互式GRPO控制组共享冻结的模拟器、代理可见对话、初始化、轨迹生成和优化,而私有的反应元数据对代理隐藏。在每个规模的三次独立训练运行中,Faca将九个领域的τ\\tau-家族平均性能分别提升了5.91和10.22个百分点。效果是异质的,最大增益出现在电信领域;在8B模型上,随机化反应极性会消除电信领域的增益。Faca训练的策略在Pare-Bench和Co-Gym上零样本测试中也优于匹配的控制组。这些结果支持了一个有条件的益处:当用户反应携带信息丰富的局部结构时,而非普遍的代理改进。  

总体而言,我们的主要贡献如下:  
- •**公式化**:我们将U2U片段形式化为局部信用分配单元,并将后续用户反应视为交互进展的时间局部化证据。  
- •**方法**:我们引入Faca,该方法添加U2U级别的反应信用,无需学习的评论家、额外的轨迹或代理可见标签。  
- •**发现**:结果显示了跨尺度增益、反应敏感性、零样本迁移和领域差异。  

## 2 相关工作  
##### 交互式用户-代理学习。  
现代面向用户的代理通过迭代沟通、工具使用和对未充分指定目标的澄清来解决实际任务(17 (https://arxiv.org/html/2608.17499#bib.bib9); 1 (https://arxiv.org/html/2608.17499#bib.bib2); 18 (https://arxiv.org/html/2608.17499#bib.bib13); 35 (https://arxiv.org/html/2608.17499#bib.bib11))。研究涵盖离线轨迹合成和在线模拟器在环强化学习。离线方法构建社交或工具使用交互以供后续训练,包括SOTOPIA-π/Ω、APIGen-MT和Magnet(25 (https://arxiv.org/html/2608.17499#bib.bib3); 32 (https://arxiv.org/html/2608.17499#bib.bib4); 16 (https://arxiv.org/html/2608.17499#bib.bib5); 30 (https://arxiv.org/html/2608.17499#bib.bib6))。LAM SIMULATOR和Simia-SFT则通过交互探索或种子集扩展生成轨迹(7 (https://arxiv.org/html/2608.17499#bib.bib7); 11 (https://arxiv.org/html/2608.17499#bib.bib8))。在线方法针对当前策略生成交互:MUA-RL和UserRL在多轮强化学习轨迹中保留模拟用户,而Simia-RL在策略优化期间使用模型模拟的环境反馈(35 (https://arxiv.org/html/2608.17499#bib.bib11); 19 (https://arxiv.org/html/2608.17499#bib.bib14); 11 (https://arxiv.org/html/2608.17499#bib.bib8))。它们将模拟用户行为直接置于学习循环中,使交互数据能够响应策略的演进行为。  

参见图例  
图2:FACA概览。  
(a) 对于每个提示,我们采样K个多轮用户交互轨迹并获得经过验证的最终任务奖励。  
(b) 一个U2U片段可能包含多个代理和工具段;下一用户调用联合产生一个*可见*话语和一个*私有*反应策略,该策略与前一个完整片段对齐。  
(c) 终端奖励产生轨迹级结果优势,而对齐的反应产生轮次级过程优势。它们的加法组合为代理优化提供最终优势。  

##### 多轮代理中的信用分配。  
终端任务奖励验证整体成功,但无法识别哪些轮次引发了有用信息、引入了错误或使得恢复成为可能。先前的工作从学习的评论家或中间评估器获取轮次级信用(37 (https://arxiv.org/html/2608.17499#bib.bib21); 36 (https://arxiv.org/html/2608.17499#bib.bib22); 2 (https://arxiv.org/html/2608.17499#bib.bib24); 26 (https://arxiv.org/html/2608.17499#bib.bib25))。Agent Lightning则将轨迹分解为过渡,并将监控信号转换为中间奖励(13 (https://arxiv.org/html/2608.17499#bib.bib23))。无评论家替代方案从延续、重复状态、策略信息、结果潜力、结构化推理事件或工具调用熵中推导局部优势(5 (https://arxiv.org/html/2608.17499#bib.bib29); 39 (https://arxiv.org/html/2608.17499#bib.bib30); 4 (https://arxiv.org/html/2608.17499#bib.bib26); 24 (https://arxiv.org/html/2608.17499#bib.bib31); 10 (https://arxiv.org/html/2608.17499#bib.bib32); 8 (https://arxiv.org/html/2608.17499#bib.bib33); 33 (https://arxiv.org/html/2608.17499#bib.bib27); 12 (https://arxiv.org/html/2608.17499#bib.bib28); 38 (https://arxiv.org/html/2608.17499#bib.bib34); 27 (https://arxiv.org/html/2608.17499#bib.bib38))。SEAL则使用基于验证器的诊断来重新加权轨迹级GRPO优势(9 (https://arxiv.org/html/2608.17499#bib.bib39))。  

用户后续回复提供互补监督:FLR使用精选的正向和负向后续回复的可能性对候选回复进行评分,而RLUF从生产反应中学习,并记录了在过度优化下的奖励破解(31 (https://arxiv.org/html/2608.17499#bib.bib15); 6 (https://arxiv.org/html/2608.17499#bib.bib16))。与这些响应级目标不同,Faca将对方的下一次反应作为紧随其后的U2U片段的信用,并与终端任务优势并列。该反应已经发生在同一次轨迹内,因此该方法既不需要额外的延续,也不需要学习的轮次级评估器。其私有策略注释仅用于构建信用,并对代理隐藏。因此,该信号既不是策略推导的不确定性,也不是从潜在模拟器状态推断的奖励。这使Faca定位为基于反应的局部U2U监督,而非分层信用分配框架。  

## 3 反馈感知信用分配  
### 3.1 交互轨迹与结果信用  
对于提示$x$,代理策略$\pi_\theta$与工具环境和冻结的用户策略$\pi_u$交互。组相对优化(22 (https://arxiv.org/html/2608.17499#bib.bib19))采样K次轨迹,$\tau_k=(x,a_{k,1},u_{k,2},\ldots,a_{k,T_k},u_{k,T_k+1})$,(1)其中$a_{k,q}$是相邻用户消息之间的完整U2U片段,可能包含多个语言和工具段。环境从最终的数据库或世界状态返回经过验证的终端奖励$R_k \in \{0,1\}$。因此,每个U2U单元保留了在控制权交还给用户之前产生的完整语言和工具行动序列。  

我们匹配的仅基于结果的交互式GRPO控制组计算:  
$A^{\mathrm{o}}_{k}=\frac{R_{k}-\mu_{R}(x)}{\sigma_{R}(x)+\epsilon}$,(2)  
并将$A^{\mathrm{o}}_{k}$广播到轨迹$k$中的每个可训练代理token。它与Faca共享用户策略、模拟器提示、代理可见对话、轨迹生成和优化。在整个训练过程中组件保持匹配。  

这个终端信号适用于多样的成功轨迹,但在时间上是平坦的:有用的引导、错误和后续修复获得相同的优势。此外,具有恒定终端奖励的组会使得$A^{\mathrm{o}}_{k}=0$。Faca保留了这个经过验证的结果分支,并在U2U级别添加了基于反应的信用。  

### 3.2 用户反应作为局部证据  
对于交互式GRPO和Faca轨迹,冻结的模拟器在同一次调用中发出一个可见话语$u_{k,q+1}$和一个私有行为策略$z_{k,q+1}$。只有话语被附加到代理上下文中。交互式GRPO丢弃$z_{k,q+1}$;Faca在轨迹构建后读取它,并将其与紧随其后的代理片段$a_{k,q}$对齐。时间邻接性是一种归纳偏置,而非声称每个反应仅由该片段引起。该策略仅在代理让出控制权后被读取,因此永远不会进入代理可见的上下文。  

我们将策略映射为三元证据:$z_{k,q+1} \rightarrow f_{k,q} \in \{-1,0,+1\}$。(3)  
确认、关闭或揭示特定请求的信息被视为*进展一致*;要求澄清、质疑解决方案或改变既定目标被视为*摩擦一致*;模糊或无效的输出被赋予中性信用。这些标签描述交互的进展而非用户情感或行动正确性。这种粗略映射在保留反应方向性的同时保留了模糊性。表1 (https://arxiv.org/html/2608.17499#S3.T1)给出了完整映射,附录B (https://arxiv.org/html/2608.17499#A2)详细说明了提取和回退行为,附录C (https://arxiv.org/html/2608.17499#A3)给出了共享的模拟器提示。仅使用话语的提取器可以消除对私有反应元数据的依赖,并将Faca扩展到超越仪器化设置,用于在受控程度较低的环境中部署。  

表1:Faca使用的用户策略映射。极性代表交互进展或摩擦的粗略证据,而非情感或经过验证的任务正确性。  

### 3.3 两级加法优势  
结果分支重用方程2 (https://arxiv.org/html/2608.17499#S3.E2)中的$A^{\mathrm{o}}_{k}$。对于提示$x$和U2U索引$q$,令$\mathcal{I}(x,q)$包含到达$q$并具有有效下一用户反应的轨迹。我们构建对齐的反应组:$\mathcal{B}^{p}(x,q)=\{f_{i,q} \mid i \in \mathcal{I}(x,q)\}$,(4)并在该局部比较集内进行归一化:  
$A^{\mathrm{p}}_{k,q}=\frac{f_{k,q}-\mu_{f}(x,q)}{\sigma_{f}(x,q)+\epsilon}$。(5)  
U2U估计器仅使用直接的下一反应,并不将后续反应向后传播。单例或常数锚点接收零。$a_{k,q}$中的每个可训练token接收:  
$A_{k,q} = A^{\mathrm{o}}_{k} + \lambda A^{\mathrm{p}}_{k,q}$。(6)  
这两个项是互补的:$A^{\mathrm{o}}_{k}$保留了终端目标,而$A^{\mathrm{p}}_{k,q}$区分了局部进展与摩擦。禁用反应分支会将方程6 (https://arxiv.org/html/2608.17499#S3.E6)简化为严格的仅基于结果的交互式GRPO控制组。在一个结果同质的组中,反应标签仍然可能在不同轨迹间有所不同;这是一种机械特性而非独立的性能主张。  

### 3.4 优化与锚定  
对于助手token,我们首先裁剪GRPO重要性比率(20 (https://arxiv.org/html/2608.17499#bib.bib20)):  
$\widetilde{\rho}_{k,t}=\operatorname{clip}\!\left(\rho_{k,t},\,1-\varepsilon,\,1+\varepsilon\right)$。(7)  
然后代入U2U级优势$A_{k,q}$,得到演员目标:  
$\displaystyle L(\theta)=-\mathbb{E}_{k,t}\!\left[\min\!\left(\rho_{k,t}A_{k,q}(t),\;\widetilde{\rho}_{k,t}A_{k,q}(t)\right)\right]$。

相似文章

TACO:面向智能体工具使用的工具增强信用优化

Hugging Face Daily Papers

TACO提出了一种针对代码工具智能体的新型信用优化方法,该方法使用差分奖励探针和结果门控优势路由来区分有用、冗余或误导性的工具调用,从而提升多模态智能体的性能。

CANTANTE:通过对比信用分配优化智能体系统 [R]

Reddit r/MachineLearning

CANTANTE 引入了一种对比信用分配方法,通过将全局奖励分解为每个智能体的信号,优化多智能体 LLM 系统,从而实现自动化提示调优。在编程、数学和检索基准测试中,它超越了基线方法,在不增加推理成本的情况下实现了最高 +18.9 分的提升。