ARC:开放式真实世界交互中的公平相对优势比较

arXiv cs.AI 论文

摘要

论文介绍了ARC,这是一种通过条件化策略轨迹来在开放式真实世界交互中实现更公平相对优势比较的训练方案,并提出了INTER3,一种响应式用户代理交互范式,可降低延迟。

arXiv:2608.13622v1 公告类型:新 摘要:开放式真实世界交互允许多种有效行为:代理可以直接回答、请求澄清、提供进度更新或在操作前确认。这种灵活性打破了基于群体的强化学习背后的一个核心假设:群体内比较的轨迹不再保证在行为上可比。因此,奖励模型对交互风格的偏好可能会扭曲相对优势,并将优化导向奖励偏好的行为而非上下文适当的行为。我们将此形式化为一个\textit{奖励公平性问题},并提出\textbf{ARC}(通过条件化的优势正则化),这是一种通过策略条件化轨迹分组恢复更公平相对比较的训练方案,结合混合奖励和熵正则化。我们在我们提出的\inter中研究ARC,这是一种响应式、可导向和执行感知的用户代理交互新范式,将用户可见通信与潜在推理和工具使用解耦。\inter还提供了构建\inter-86K的注释和蒸馏管道,这是我们用于监督和强化学习训练的策略注释训练语料库。实验上,ARC显著增强了核心$\tau/\tau^2$工具使用基准,而\inter将首个令牌时间从4.91秒减少到1.27秒,相对于思考风格基线。总之,这些结果表明,开放式交互学习中的一个中心瓶颈不仅在于代理如何获得奖励,还在于它们的行为是否首先被公平比较。ARC实现和\inter-86K训练数据将被发布。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:46

# 1 引言
来源:https://arxiv.org/html/2608.13622
技术报告
2026年8月13日

ARC:开放式真实世界交互中的公平相对优势比较

永岐童\*谭力辉Faith\*蔡振文Marcus\*周金科维付江-明杨建设李鑫张
蚂蚁国际
\{tongyongqi\.yq, faith\.t, marcus\.choy, xiaocao\.zj, fukewei\.fkw, jmyang, zhouran\.ljs, evan\.zx\}@ant\-intl\.com

框架代码:ASRI (https://github.com/ant-intl/asri)
数据集:[![[无标题图像]](https://arxiv.org/html/2608.13622v1/assets/huggingface-logo.png)ARC](https://huggingface.co/datasets/ant-intl/ARC)

摘要
开放式真实世界交互允许多种有效行为:智能体可以直接回答、要求澄清、提供进度更新,或在行动前确认。这种灵活性打破了基于分组强化学习的一个核心假设:在组内进行比较的rollout不再保证在行为上是可比较的。因此,奖励模型对交互风格的偏好可能会扭曲相对优势,并将优化引向奖励偏好的行为,而非适合上下文的行为。我们将此形式化为一个奖励公平性问题,并提出ARC(通过条件进行优势正则化),这是一种通过策略条件rollout分组、结合混合奖励和熵正则化来恢复更公平相对比较的训练方案。我们在我们提出的INTER3中研究ARC,这是一种新颖的、响应式、可引导且执行感知的用户-智能体交互范式,它将用户可见的通信与潜在推理和工具使用解耦。INTER3还提供了标注和蒸馏流程,用于构建INTER3-86K,这是我们为监督学习和强化学习训练提供的策略标注训练语料库。实证上,ARC显著增强了核心的τ/τ²工具使用基准,而INTER3与思考风格基线相比,将首字节时间从4.91秒减少到1.27秒。这些结果共同表明,开放式交互学习中的一个核心瓶颈不仅在于智能体如何获得奖励,还在于他们的行为是否从一开始就被公平地比较。ARC的实现和INTER3-86K训练数据将会发布。

关键词:强化学习,AI智能体,工具使用,交互策略,优势估计

## 1 引言
参见标题
图1:ARC概述。ARC修改了基于分组的强化学习,在训练期间将每个示例与策略指令配对,因此rollout仅在策略条件分组内进行比较,通过消除跨策略污染来产生更清晰的相对优势。在推理时,指令被移除,策略自主选择策略,使ARC成为在开放式交互中实现更公平优势估计的通用方案。

基于分组的强化学习和RLHF方法通过采样组内的相对奖励进行学习,已成为语言模型和智能体的标准后训练方案41 (https://arxiv.org/html/2608.13622#bib.bib27);1 (https://arxiv.org/html/2608.13622#bib.bib37);42 (https://arxiv.org/html/2608.13622#bib.bib26);63 (https://arxiv.org/html/2608.13622#bib.bib40);27 (https://arxiv.org/html/2608.13622#bib.bib41)。当被比较的rollout占据局部可比较的响应区域时,其信号最具可解释性,此时中心化奖励主要反映质量差异,而非质上不同的行为模式。然而在实践中,已知奖励模型会依赖于诸如响应长度和文体形式等虚假属性,并且强化学习策略在优化过程中可能会利用这些偏差6 (https://arxiv.org/html/2608.13622#bib.bib38);12 (https://arxiv.org/html/2608.13622#bib.bib39)。当一个rollout组跨越显著不同的行为时,这些偏差在组内可能并不一致:样本可能落在奖励模型偏好景观的不同区域,因此中心化奖励可能同时包含质量差异和区域特定的奖励偏好。比较仍然是相对的,但不再公平。

这个问题在真实的现实世界交互中尤为突出,因为许多任务在对话轮次层面是开放式的,单个对话状态可能允许多个合适的下一步动作62 (https://arxiv.org/html/2608.13622#bib.bib5);60 (https://arxiv.org/html/2608.13622#bib.bib8);4 (https://arxiv.org/html/2608.13622#bib.bib9)。智能体可以直接回答、要求澄清、在工具运行期间提供进度更新,或在不可逆行动前确认;哪种选择最好取决于缺失信息、行动可逆性以及演变中的用户-智能体状态60 (https://arxiv.org/html/2608.13622#bib.bib8);4 (https://arxiv.org/html/2608.13622#bib.bib9);11 (https://arxiv.org/html/2608.13622#bib.bib28);51 (https://arxiv.org/html/2608.13622#bib.bib70)。与具有单一可验证目标的短程推理领域不同,这些交互选择通常没有唯一标准答案,即使它们都是任务合适的60 (https://arxiv.org/html/2608.13622#bib.bib8);4 (https://arxiv.org/html/2608.13622#bib.bib9)。因此在一个rollout组内比较它们,会将策略多样性与奖励模型偏好纠缠在一起。

我们将这种混淆形式化为奖励公平性问题:当一个提示存在多种有效策略时,跨策略比较会偏差基于分组的相对优势估计,并可能将优化扭曲向奖励偏好的交互风格。我们使用ARC(通过条件进行优势正则化)来解决这个问题。ARC为每个示例分配一个训练时策略指令,在该策略条件比较类内采样多个rollout,仅在组内计算相对优势,并使用我们的混合奖励和熵正则化目标更新策略。图1 (https://arxiv.org/html/2608.13622#S1.F1)提供了高层概述。在推理时,策略指令被移除,策略自主选择交互策略。这与基于提示或指导的强化学习方法不同,后者使用辅助信息来揭示解决方案结构、优待更强的轨迹或改进探索23 (https://arxiv.org/html/2608.13622#bib.bib22);18 (https://arxiv.org/html/2608.13622#bib.bib23);59 (https://arxiv.org/html/2608.13622#bib.bib24);66 (https://arxiv.org/html/2608.13622#bib.bib25)。ARC使用辅助信息的目的不同:不是为了让答案更容易找到,而是为了在rollout之间进行公平比较。

然而,现有的智能体框架仍然是研究真实交互下这个问题的薄弱基础,用户可能会在执行完成前中断、重定向、暂停或失去耐心,并且实现相同任务结果的轨迹仍可能引发实质上不同的交互体验60 (https://arxiv.org/html/2608.13622#bib.bib8);4 (https://arxiv.org/html/2608.13622#bib.bib9);68 (https://arxiv.org/html/2608.13622#bib.bib44);24 (https://arxiv.org/html/2608.13622#bib.bib45);67 (https://arxiv.org/html/2608.13622#bib.bib47)。先思考后行动的智能体通常将用户可见的通信推迟到隐藏的推理-工具轨迹终止之后,而ReAct智能体将推理、行动和通信混合在单个可见轨迹中62 (https://arxiv.org/html/2608.13622#bib.bib5);22 (https://arxiv.org/html/2608.13622#bib.bib48);57 (https://arxiv.org/html/2608.13622#bib.bib49)。这两种范式都主要为骨干能力和任务成功而优化。因此,它们主要累积具有可验证结果的轨迹,而非开放式交互数据——在这些数据中,多种有效的交错策略可能都解决了任务,却引发了不同的用户体验。

因此,我们构建了INTER3(内部推理、工具使用和交互的交互),这是一个通道分离的框架,其系统提示明确定义了与ARC使用的策略家族对齐的交互策略。通过将<span>跨度</span>与潜在推理和工具执行分离,INTER3将进度更新、澄清、对齐检查和执行中引导转化为一等公民、可控且可标注的行为;这既拓宽了对话风格的多样性,也为ARC提供了更清洁的rollout组以实现更公平的比较。相同的接口将首字节时间(TTFT)相对于先思考后行动的基线从4.91秒减少到1.27秒。部署后,我们以这种格式收集真实的在线交互轨迹,用精选的公共数据增强它们,并合成与ARC策略家族对齐的大规模多样化交互轨迹,产生INTER3-86K,一个包含86K示例的策略标注语料库和用于公平跨策略比较的现实基础。

我们的理论分析将跨策略方差隔离为标准基于分组强化学习中估计误差的一个来源,并表明理想的策略条件可以从中心化优势方差分解中移除这一项。我们的实证结果随后表明,当在INTER3-86K上训练时,ARC显著改进了工具使用设置下的开放式智能体强化学习。额外的诊断使机制更加具体:策略提示在训练期间很重要,而在推理时省略它们则恢复了最佳的整体行为,这表明ARC不仅仅是在拟合提示侧的指令,而是在学习一个更通用的交互策略。总之,INTER3和ARC解决了问题的两个方面:INTER3提供了一个现实的交互框架,其中可以观察和收集多样化的有效行为;而ARC解决了这些行为在优化期间应如何比较的问题。我们将这种组合视为迈向开放式真实世界智能体训练的实用一步,其核心挑战是从现实的交互数据中学习,同时在多种有效行为没有单一精确答案时保持公平的相对比较。

我们的贡献有三方面:
- • 我们提出ARC,一种策略条件的分组强化学习方案,用于缓解开放式真实世界智能体交互中不公平的优势比较,并分析了它如何减少基于分组优势估计中的跨策略方差。
- • 我们构建INTER3,一个异步流式交互框架,将用户可见的通信与潜在推理和工具执行分离,支持显式策略控制和用户中断,并使开放式交互对于训练可观察。
- • 我们构建INTER3-86K,一个来自真实在线轨迹、精选公共数据和合成轨迹的策略标注训练基础,并表明它使ARC能够改进开放式智能体强化学习,同时在无提示推理中实现最佳泛化。

## 2 相关工作
工具增强智能体在推理、规划和外部行动方面取得了快速进展40 (https://arxiv.org/html/2608.13622#bib.bib1);34 (https://arxiv.org/html/2608.13622#bib.bib2);62 (https://arxiv.org/html/2608.13622#bib.bib5);11 (https://arxiv.org/html/2608.13622#bib.bib28);35 (https://arxiv.org/html/2608.13622#bib.bib30);49 (https://arxiv.org/html/2608.13622#bib.bib64),而最近的交错工作通过在思考和部分输出之间交替提高了响应性22 (https://arxiv.org/html/2608.13622#bib.bib48);57 (https://arxiv.org/html/2608.13622#bib.bib49)。我们的不同之处在于架构:INTER3将可见交互与潜在推理和工具执行分离,因此用户无需等待整个内部轨迹完成才能进行通信。这使响应性从解码行为变为接口属性,并使策略多样性在现实的智能体循环中可操作。

在强化学习方面,我们的工作建立在策略梯度和RLHF估计器之上41 (https://arxiv.org/html/2608.13622#bib.bib27);1 (https://arxiv.org/html/2608.13622#bib.bib37);37 (https://arxiv.org/html/2608.13622#bib.bib35);13 (https://arxiv.org/html/2608.13622#bib.bib36),特别是基于分组相对方法如GRPO及其后续工作42 (https://arxiv.org/html/2608.13622#bib.bib26);63 (https://arxiv.org/html/2608.13622#bib.bib40);27 (https://arxiv.org/html/2608.13622#bib.bib41)。当组内样本具有可比性时,这些方法是有效的。我们关注的是一个不同的失败模式:在开放式智能体交互中,有效的rollout可能在策略上而非仅仅在质量上有所不同,因此跨策略比较可能直接将奖励模型偏好注入相对优势估计中。ARC在rollout构建时解决这个可比性问题。

最接近的方法论邻居是指导增强的强化学习方法,如SAGE、Scaffold-GRPO、LUFFY和ExGRPO23 (https://arxiv.org/html/2608.13622#bib.bib22);18 (https://arxiv.org/html/2608.13622#bib.bib23);59 (https://arxiv.org/html/2608.13622#bib.bib24);66 (https://arxiv.org/html/2608.13622#bib.bib25),它们引入辅助信号以改进探索、缓解稀疏奖励或重用成功经验。ARC也使用辅助指令,但目的不同:不是为了让任务更容易,而是为基于分组相对优化定义一个更清洁的比较类。关于相邻的工具使用、交互和指导文献的更多讨论推迟到附录B (https://arxiv.org/html/2608.13622#A2)。

## 3 INTER3设置
### 3.1 交互接口
ARC在INTER3中进行评估,这是一个用于开放式智能体的通道分离交互设置。INTER3的核心设计选择是将*交互通道*与*执行通道*分离。在<span>外部</span>的纯文本被视为潜在推理,<span>跨度</span>流式传输给用户,工具调用仍然是结构化的内部操作,其结果返回上下文。这使得用户可见的通信在隐藏的推理-工具轨迹终止之前可用,并且允许相同的基础任务与不同的有效通信策略配对。该机制与模型无关,只需要两个实现更改:在分词器中添加<span>标签</span>,以及对生成的文本进行后处理以提取用户可见的<span>跨度</span>。

图2 (https://arxiv.org/html/2608.13622#S3.F2)说明了生成的执行模式。
参见标题
图2:标准先思考后回答(左)在回答前完成推理和工具执行,导致高TTFT且无引导,而INTER3(右)交错推理、回答和工具使用,允许实时引导和更快的TTFT。

### 3.2 运行时设计原理
INTER3在轻量级异步流式智能体运行时中实例化,因为标准的智能体轨迹是本文研究的交互行为的薄弱基础。严格的先思考后行动管道将用户可见的通信延迟到执行完成之后,而单片的ReAct风格轨迹将推理、行动和通信混合在单个流中。两者都不能产生干净的开放式交互数据,其中进度更新、澄清、对齐检查和重定向等行为是显式且可单独标注的。由于<span>跨度</span>可以在隐藏执行完成之前发出,通道分离交互实现了显著更低延迟的操作模式。如图3 (https://arxiv.org/html/2608.13622#S3.F3)所示,这减少了感知延迟,同时在执行期间保持持续交互。

我们的运行时将这些行为保留为统一会话中的一等公民事件。单个智能体循环可以继续隐藏推理、发出用户可见的<span>跨度</span>、发出工具调用并响应用户中断,使交互策略在整个执行过程中可观察,而不仅仅是在最终结果中。

有两个设计选择对于训练至关重要。首先,提示侧策略定义是显式的,并与ARC条件家族对齐,因此运行时控制、标注和rollout分组是...

相似文章