TRACE:通过合成奖励训练用于因果探索的推理代理

arXiv cs.AI 论文

摘要

TRACE提出一种基于模拟的方法,利用合成奖励训练用于因果探索的推理代理,提升诊断任务中的强化学习效果。实验表明,在数字广告诊断环境中,该方法优于提示基线。

arXiv:2609.10315v1 公告类型:新 摘要:具有可验证奖励的强化学习(RLVR)在数学和代码等领域推动了语言模型推理的进步,在这些领域中,客观答案易于验证。然而,对复杂数据进行诊断推理缺乏这一优势:确定异常的真实原因通常需要昂贵的专家调查,并且事后可能仍存在模糊性。我们探究是否可以通过工程化手段来解决这种验证不对称性。我们采样一个干预,将其注入到一个受控模拟器中,并生成它会产生观察结果。隐藏的干预提供了预言标签和客观奖励,而代理仍需调查嘈杂、混淆和分散的证据。我们在TRACE中实例化了这种方法,这是一个具有12个根本原因和细粒度分段归因的数字广告诊断环境。代理使用Python和SQL调查每个场景,必须识别根本原因,并在适用时识别受影响的分段分配。在一个保留的235个场景测试集上,最强的提示基线Claude Opus 5达到了0.686的FullAttr@1分数。监督微调将Qwen3.5-35B-A3B从0.159提升到0.637,随后使用合成奖励的强化学习达到0.757,优于所有评估的提示基线,包括前沿闭源模型和提示的Qwen3.5-122B-A10B模型。生成的策略在工具调用次数上也显著少于提示的35B基础模型。这些结果表明,获得可扩展的客观训练信号可能比模型规模本身更为重要。更广泛地说,基于模拟的验证可以使原本模糊的诊断推理任务变得适合可扩展的强化学习。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:45

# TRACE:利用合成奖励训练用于因果探索的推理智能体  
来源:https://arxiv.org/html/2609.10315  
###### 摘要  

可验证奖励的强化学习(RLVR)已在数学和代码等客观答案易于验证的领域推动了语言模型推理的发展。然而,针对复杂数据的诊断推理缺乏这一优势:确定异常现象的真实原因通常需要昂贵的专家调查,且事后可能仍存在不确定性。我们提出,是否可以通过工程化手段来创造这种验证的不对称性。我们采样一次干预操作,将其注入受控模拟器,并生成该干预将产生的观测结果。隐藏的干预提供了神谕标签和客观奖励,而智能体仍需调查嘈杂、混淆且分布式的证据。  

我们在TRACE中实例化了这一方法,TRACE是一个包含12种根因和细粒度细分归因的数字广告诊断环境。智能体使用Python和SQL调查每个片段,必须识别根因,并在适用时识别受影响的细分分配。在包含235个片段的留出测试集上,经过提示的最强基线Claude Opus 5达到了0.686的FullAttr@1指标。监督微调将Qwen3.5-35B-A3B的该指标从0.159提升至0.637,随后使用合成奖励的强化学习进一步将其提升至0.757,超越了所有评估过的提示基线,包括前沿闭源模型和经过提示的Qwen3.5-122B-A10B模型。此外,训练后的策略比提示的35B基础模型使用了显著更少的工具调用。这些结果表明,获取可扩展的客观训练信号可能比模型规模本身更为关键。更广泛地说,基于模拟的验证可以使原本存在歧义的诊断推理任务能够通过可扩展的强化学习来解决。

## 1 引言  

可验证奖励的强化学习(RLVR)推动了近期大语言模型推理的进展。在数学推理(Guo et al., 2025; Shao et al., 2024)和编码智能体(Wei et al., 2026; Luo et al., 2025b)方面的研究表明,针对客观验证器优化的策略可以获得多步推理和工具使用能力。这些领域提供了一种天然的*验证不对称性*:将解决方案与已知答案或测试套件进行验证,比生成解决方案本身要容易得多(Wei, 2025)。RLVR将这种不对称性转化为可扩展的训练信号。  

许多实际的推理任务缺乏此类验证器。对复杂数据的诊断推理就是一个典型例子:确定系统为何发生变化可能需要昂贵的专家调查,而即使事后,所得的归因也可能仍不确定。可能同时发生多种变化,观测存在噪声,且合理的原因可能产生相似的特征。大语言模型裁判(LLM-as-judge)方法(Zheng et al., 2023; Bai et al., 2022; Lee et al., 2024)并未消除这一瓶颈,因为目标本身仍存在歧义,而学习的裁判可能引入额外的奖励黑客(reward hacking)机会(Gao et al., 2023; Skalse et al., 2022)。因此,在这些场景中应用RLVR的主要障碍是获取可扩展、客观的基准真相。  

在本文中,我们探讨是否可以*工程化*这种验证不对称性。我们不是观察数据并试图确定一个未知原因,而是首先采样一次干预,将其注入受控模拟器,并生成该干预将产生的观测结果。隐藏的干预被保留为神谕标签,使得智能体最终的归因验证变得廉价且确定。智能体不会观察到此标签:它仍需调查嘈杂、混淆且分布式的证据以找出原因。因此,模拟将解决诊断任务的难度与验证其答案的难度分离开来。  

我们在TRACE(Training Reasoning Agents for Causal Exploration)中实例化了这一方法,这是一个用于数字广告的模拟诊断环境。每个TRACE实例向智能体呈现一个广告活动性能异常和一个多表数据库。智能体通过Python和SQL进行调查,在假设和证据之间迭代,最终将异常归因于预定义的原因类型之一,同时排除真实的混淆因素。TRACE构建了一个*模拟器–神谕–RL流程*:模拟器注入隐藏的干预,神谕验证智能体可见的数据是否包含足够证据来恢复该干预,然后强化学习使用生成的隐藏标签作为合成奖励。我们将这种设置称为*使用合成奖励的RL*,其中隐藏的干预标签被转换为客观的奖励信号。  

我们在一个为细分特定归因而丰富的包含235个片段的留出测试集上进行了评估。经过提示的最强基线Claude Opus 5达到了0.686的FullAttr@1指标。在Qwen3.5-35B-A3B上,监督微调将FullAttr@1从0.159提升至0.637,随后使用合成奖励的强化学习将其进一步提升至0.757,超越了所有评估过的提示基线。经过后训练的35B模型也显著优于经过提示的Qwen3.5-122B-A10B模型,后者的指标为0.283。这一结果表明,对于这种诊断设置,关键的制约因素是获取有效的后训练信号——包括可扩展、客观的奖励——而非仅仅模型规模。最佳训练策略的平均每条轨迹工具调用次数为11.73次,而经过提示的35B基础模型为22.05次。  

我们的贡献有三方面。首先,我们引入了一种模拟器–神谕–RL方法论,用于在缺乏自然验证器的领域合成客观奖励。核心思想是通过受控干预来生成任务,使得创建困难推理问题的过程同样提供客观答案。其次,我们在TRACE中实例化了这一方法论,这是一个使用工具的诊断环境,具有可配置的原因、真实的混淆因素和多表证据。TRACE支持留出评估和后训练,无需人工归因标签或大语言模型裁判。第三,我们表明,监督微调后接使用TRACE合成奖励的强化学习,显著提升了一个开源35B推理智能体的能力,使其在诊断归因任务上能够超越前沿闭源模型。我们还进行了消融实验,以研究监督初始化和强化学习奖励设计在产生这些收益中的作用。综合来看,这些结果展示了基于模拟的验证如何使原本存在歧义的诊断推理任务能够通过可扩展的强化学习来解决。

### 1.1 相关工作  

#### RLVR与推理训练。  
RLVR方法针对可验证的结果优化策略,包括数学答案检查器(Shao et al., 2024; Guo et al., 2025)、形式证明验证器(Kim and Yun, 2026)以及代码的编译或执行测试(Wei et al., 2026; Luo et al., 2025b)。近期工作通过改进底层策略优化算法(Shao et al., 2024; Yu et al., 2026; Liu et al., 2025; Zheng et al., 2025)以及将训练配方扩展到数学和代码之外(例如医疗问答(Chen et al., 2025))来拓宽RLVR。然而,这些进展仍然假设可验证的目标已经存在。我们的工作则研究如何为这些目标并不自然存在的领域构建它们。

#### 合成数据、模拟器与奖励合成。  
合成生成已被广泛用于为监督微调创建指令遵循数据和推理轨迹(Wang et al., 2023; Luo et al., 2025a; Yu et al., 2024)。在这些设置中,生成器主要提供要模仿的示例。相关工作开发了模拟和交互环境,用于评估使用工具的智能体在科学、网络和机器学习任务中的表现(Wang et al., 2022; Zhou et al., 2024; Huang et al., 2024)。这些环境使用交互来测试智能体能否完成任务。TRACE以不同方式使用模拟:它采样一个隐藏的根因,生成该根因将产生的诊断数据,并使用采样的原因作为奖励计算的神谕标签。

#### 使用工具的数据分析与诊断智能体。  
越来越多的工作评估大语言模型智能体能否使用外部工具分析结构化数据。Text-to-SQL基准测试为这一场景提供了一个早期测试平台,要求模型将自然语言问题翻译成可执行的数据库查询(Yu et al., 2018; Zhong et al., 2017; Li et al., 2023; Chang et al., 2023)。最近的数据分析基准测试则转向跨表、文件和代码执行的多步工具使用(Huang et al., 2024; Zhang et al., 2026)。这些任务捕捉了诊断调查的重要组成部分,但它们通常评估查询正确性、代码输出或最终报告,而不是在受控混淆因素下的根因归因。TRACE通过构建具有模拟干预、智能体可见证据和可验证奖励的诊断任务来填补这一空白。

#### 因果推理与根因归因。  
另一类工作评估大语言模型能否回答因果问题、基于因果图进行推理或从数据中恢复因果结构(Jin et al., 2023; Jin et al., 2024; Kiciman et al., 2024; Wang, 2024)。这些基准测试通过静态问题、符号图或固定数据集来探究因果知识和形式因果推理。TRACE研究的是一个不同的场景:在模拟环境中的交互式根因归因,其中真实原因在设计上是已知的。智能体必须通过SQL和Python收集证据,区分采样的原因与真实的混淆因素,并生成可针对基准真相标签进行验证的归因。

## 2 TRACE环境  

本节描述TRACE,一个实现我们方法论中模拟器–神谕组件的数字广告环境。TRACE包含三个部分:一个随机模拟器,用于生成具有已知注入原因的多表广告数据;一个任务接口,智能体通过它调查每个生成的诊断实例;以及一个神谕验证器,用于认证可解性并产生奖励标签。图1(https://arxiv.org/html/2609.10315#S2.F1)总结了整个工作流程。我们将每个生成的诊断实例称为一个*片段*:单个广告活动在固定时间窗口内的可观测历史,以及定义了基准真相原因的隐藏注入干预。

参考图注图1:TRACE工作流程概述。### 2.1 预备知识:广告活动指标与诊断  

数字广告活动通过在线竞价向用户提供广告:当用户加载带有广告位的页面时,广告主为该广告位出价,获胜的广告作为*展示*被展示。在常用的按点击付费(pay-per-click)模型中,广告主仅在用户*点击*时被收费,而导致购买广告产品的点击被记录为*订单*或*转化*。广告活动性能通常由展示量、点击率(CTR,点击数/展示量)、转化率(CVR,订单数/点击数)和单次点击成本(CPC,广告主总支出/点击数)等指标来总结。111在通用的第二价格拍卖机制中,广告主支付的价格取决于竞争对手的出价,而非广告主自身。我们对出价与CPC之间的这种差异建模为对广告主支出的乘性噪声。这些指标在广告活动级别和跨*细分*(细分是诸如版位、设备、地理位置或用户群等分类属性的组合)进行报告。

细分层面的报告使得诊断既可能又困难。展示量在各细分中的分布由相互作用的因素决定,包括广告活动配置、竞争广告活动、竞价动态和用户行为。这些因素也产生日常的指标噪声。区分真实的性能变化与这种噪声需要解决三个问题。首先,原因是模糊的:一个指标变动可能有多种解释(*是什么*)。其次,原因是局部的:细分层面的效果可能在活动总量中被稀释,只有在正确的划分下才会显现(*在哪里*)。第三,时机未知:渐进的开始很容易被简单的时期比较错过(*何时*)。同时解决所有这三个问题是TRACE旨在引出的核心推理模式。

### 2.2 数据生成流程  

对于每个TRACE片段,采样的干预决定了三个隐藏标签:原因类型、受影响的细分切片和开始时机。  

生成过程分三个阶段进行:构建广告活动总体(阶段1)、采样干预(阶段2)以及模拟产生的指标(阶段3)。

#### 阶段1:广告活动总体。  
我们首先构建一个静态的广告活动宇宙。每个活动被分配一个垂直类别(例如电子产品、时尚)、一种竞价策略(例如搜索主导、获客)、一个基线每日预算和一个基线展示量。一个活动在其可能的细分的一个采样子集上是活跃的。每活动的点击率和转化率的变化由一个质量乘数来捕获。

#### 阶段2:干预采样。  
每个片段跨越一个连续的窗口,该窗口被分成相等的两部分:*基线期*,在此期间广告活动正常运行;以及*干预期*,在此期间采样的原因处于活跃状态。我们抽取四个组成部分:*注入的原因*,十二种预定义原因之一(§2.3);*驱动切片*,使用一个或两个属性指定受影响的细分,例如`placement=TOP_OF_SEARCH`或`geo=US ∧ device=mobile`;*信号强度*,设置效果大小;以及*开始剖面*,决定效果是立即出现、延迟出现还是随时间逐渐出现。

#### 阶段3:指标模拟。  
模拟器渲染每日

相似文章

Reasoning Arena: 当可验证奖励不足时的追踪锦标赛

Hugging Face Daily Papers

Reasoning Arena 通过使用追踪锦标赛和Bradley-Terry模型,从非多样化奖励组中生成有意义的梯度,从而改进了基于可验证奖励的强化学习,实现了更快的训练和更好的推理性能。

从智能体轨迹中诱导推理原语

arXiv cs.AI

介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。