面向回合级智能体强化学习的科学发现环境扩展

arXiv cs.AI 论文

摘要

本文介绍了SciDisco,一个可扩展的框架,用于通过过程可验证环境、基于DAG的轨迹合成和回合级强化学习来训练科学发现智能体。所提出的SciDisco-14B模型在假设驱动的科学数据分析基准上达到了最先进水平。

arXiv:2607.28990v1 公告类型:新增 摘要:大语言模型智能体在数据驱动的科学发现任务中展现出有前景的能力,在该任务中,智能体与执行环境交互并产生统计主张。长期科学分析仍然受到缺乏基于真实世界科学数据的过程监督环境的限制。本文介绍了SciDisco,一个可扩展的框架,用于在过程可验证环境中训练科学发现智能体。SciTh\`eque将假设、数据集、隐藏证据图和验证器编译为任务环境,使得在交互过程中可以检查分析进展。基于DAG的轨迹合成利用这些环境构建经过验证器筛选的多轮演示。DiscoPO随后将环境作为训练信号来源,为产生可验证分析证据的动作分配回合级贡献。实验表明,SciDisco-14B在假设驱动的科学数据分析基准上达到了最先进水平。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:30

# 扩展面向轮次级智能体强化学习的科学发现环境

来源:https://arxiv.org/html/2607.28990

Yucheng Xu†\dagger, Keyi Zhang†\dagger, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu\*  
上海人工智能实验室  
†\dagger 同等贡献  
\* 通讯作者

###### 摘要

大语言模型智能体在数据驱动的科学发现任务中展现出了有前景的能力,这类任务中智能体与执行环境交互并产生统计结论。长周期科学分析仍然受限于缺乏基于真实世界科学数据的过程监督环境。本文介绍了**SciDisco**,一个可扩展的框架,用于在过程可验证的环境中训练**科学发现**智能体。**SciThèque**将假设、数据集、隐藏证据图和验证器编译为任务环境,在交互过程中可以检查分析进度。基于 DAG 的轨迹合成利用这些环境构建经过验证器过滤的多轮演示。**DiscoPO**随后将环境作为训练信号来源,为产生可验证分析证据的动作分配轮次级信用。实验表明,SciDisco-14B 在假设驱动的科学数据分析基准上达到了最先进水平。

# 扩展面向轮次级智能体强化学习的科学发现环境

Yucheng Xu†\dagger, Keyi Zhang†\dagger, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu\*  
上海人工智能实验室  
†\dagger 同等贡献  
\* 通讯作者

## 1 引言

数据驱动的科学发现是一种基于假设的、对现有科学数据集进行实证研究的方式。在人类实践中,它要求研究人员理解科学背景和数据结构,选择合适的方法,执行统计分析,并得出可验证的结论。现有 LLM 和基于 LLM 的智能体在此场景下仍然不可靠。先前工作表明,模型在统计方法适用性和基于数据的因果推理方面存在困难(Zhu et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib15); Liu et al., 2024a (https://arxiv.org/html/2607.28990#bib.bib16))。智能体代码和推理脚手架在数据驱动发现基准上也表现有限(Majumder et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib1); Gu et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib17); Chen et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib18))。这些结果表明,数据驱动的科学发现不应被视为一次性问答或单轮代码生成,而应视为一个在真实数据上执行、观察、修正和验证分析的交互过程。

核心挑战是训练能够学习稳健交互策略的智能体,而不仅仅是编码科学知识或生成代码。提示和手写脚手架可以描述分析工作流的步骤,但基准证据表明,提示和通用多轮训练无法可靠地产生目标导向的交互。相比之下,经过奖励训练的工具使用可以在陌生工具场景中胜过监督式工具轨迹(Abdulhai et al., 2023 (https://arxiv.org/html/2607.28990#bib.bib19); Qian et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib20); Wang et al., 2025b (https://arxiv.org/html/2607.28990#bib.bib23))。因此,数据驱动发现智能体必须从环境反馈中学习何时检查数据、选择方法、检验假设、修正分析以及提交结论。这推动我们训练科学数据环境内的专用发现智能体,而不是仅仅依赖基础模型或推理时工作流编排。

这种训练需要既可执行又可验证的环境。一个发现型 RL 环境应提供数据驱动目标、有状态代码执行、观察结果和自动验证。开放科学数据集数量丰富,但它们通常只是静态文件或元数据,缺乏任务目标或验证器。现有科学发现基准提供了有价值的评估任务和真实标准,但它们不暴露隐藏的科学证据状态,无法用于大规模过程监督训练,也不具备跨轮次持久状态和基于验证器的轮次信用(Majumder et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib1); Gu et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib17); Chen et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib18))。通用智能体和 ML 工程环境支持可执行反馈,在某些情况下也支持训练,但其目标针对网页交互或 ML 工程,而非真实数据假设验证(Liu et al., 2024b (https://arxiv.org/html/2607.28990#bib.bib21); Chan et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib22); Qiang et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib34); Zhou et al., 2026 (https://arxiv.org/html/2607.28990#bib.bib35))。

仅有可执行环境仍然不足以实现有效的 RL。如果没有行为先验,早期 rollout 可能被无效工具调用、变量误读和不完整分析所主导。数据驱动的科学发现还带来了长周期信用分配问题:最终结论依赖于模式理解、方法选择、代码执行、诊断和证据解释,而仅基于结果的奖励无法识别哪些轮次产生了有效的分析证据(Wang et al., 2025b (https://arxiv.org/html/2607.28990#bib.bib23); Wei et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib24); Li et al., 2026b (https://arxiv.org/html/2607.28990#bib.bib25); Xie et al., 2026 (https://arxiv.org/html/2607.28990#bib.bib26))。这些局限指向了智能体训练中的一个空白:数据驱动的科学发现需要一种接口,使分析进度能够在交互过程中被执行、验证和授予信用。

**SciDisco**为数据驱动的科学发现智能体提供了这样的框架。其环境层 **SciThèque** 将开放科学数据集编译为可验证的假设驱动环境。隐藏证据 DAG 支持用于 SFT 的经过验证的多轮演示,并提供过程反馈,**DiscoPO** 在智能体 RL 中利用这些反馈进行轮次级信用分配。因此,SciDisco 将任务构建、行为模仿和策略优化对齐到真实的科学数据环境中。本文做出三项贡献:

1. **SciThèque** 从开放科学数据集构建可扩展的发现环境,包含假设、沙箱执行和验证器。
2. **DAG 引导的轨迹合成** 使用经过验证的多轮演示来冷启动智能体行为。
3. **DiscoPO** 为经过验证的、产生证据的过程分配轮次级信用,而不仅仅是最终答案。

## 2 相关工作

### 2.1 发现智能体与环境

先前关于数据科学和科学发现智能体的工作遵循两大范式。第一种提升数据特定能力,包括表格理解、数据库操作、统计推理和基于数据的定量推理(Zhu et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib15); Liu et al., 2024a (https://arxiv.org/html/2607.28990#bib.bib16))。第二种超越单轮问答,通过 ReAct 风格交互、代码解释器、多智能体脚手架或学习到的分析轨迹构建智能体工作流。这些系统通常依赖强大的闭源模型,导致底层训练环境难以复用(Guo et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib27); Zhang et al., 2023 (https://arxiv.org/html/2607.28990#bib.bib28); Hong et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib29); Li et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib30); Zhang et al., 2025b (https://arxiv.org/html/2607.28990#bib.bib12); Qiao et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib14))。这使得很难将模型能力与用于产生科学结论的可执行交互和验证基础分离。

发现基准在真实数据、开放问题、代码执行和结论检查方面评估智能体(Majumder et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib1); Gu et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib17); Chen et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib18); Egg et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib2))。交互式科学环境支持基于文本或虚拟世界的探索(Wang et al., 2022 (https://arxiv.org/html/2607.28990#bib.bib31); O’Sullivan et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib32))。通用智能体和 MLE 环境涵盖工具使用、网页交互、可执行反馈和训练效率(Liu et al., 2024b (https://arxiv.org/html/2607.28990#bib.bib21); Zhou et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib33); Chan et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib22); Qiang et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib34); Zhou et al., 2026 (https://arxiv.org/html/2607.28990#bib.bib35))。这些场景很有价值,但它们并非围绕真实数据假设验证、持久执行状态和基于验证器的过程反馈构建。SciThèque 构建了可执行、可验证的发现环境,将数据、假设、代码执行和可复用的多轮反馈连接起来,使同一环境既可以定义任务、过滤轨迹,又可以提供 RL 信号。这把环境的作用从静态评估工件转变为可复用的科学智能体学习训练接口。

### 2.2 面向 LLM 智能体的强化学习

超越提示和 SFT,近期工作使用强化学习训练 LLM 智能体。GRPO 风格的 RLVR 使用组相对优势来避免显式评论者,并训练模型处理可验证的推理或编码任务(Shao et al., 2024 (https://arxiv.org/html/2607.28990#bib.bib37); Guo et al., 2025a (https://arxiv.org/html/2607.28990#bib.bib38))。后续变体改进了采样、裁剪、归一化、长度偏差和自蒸馏路由(Yu et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib39); Liu et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib40); Li et al., 2026a (https://arxiv.org/html/2607.28990#bib.bib41))。这些方法为智能体训练提供了强大的优化主干,但其奖励通常仍停留在响应或轨迹级别。对于多轮智能体,近期工作以步骤、轮次或片段粒度分配信用,或通过后见之明、反思或轨迹校正来校准中间决策(Feng et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib42); Wei et al., 2025 (https://arxiv.org/html/2607.28990#bib.bib24); Li et al., 2026b (https://arxiv.org/html/2607.28990#bib.bib25); Zong et al., 2026 (https://arxiv.org/html/2607.28990#bib.bib47); Guo et al., 2025b (https://arxiv.org/html/2607.28990#bib.bib43); Lu et al., 2026 (https://arxiv.org/html/2607.28990#bib.bib44); Wang et al., 2025a (https://arxiv.org/html/2607.28990#bib.bib45), c (https://arxiv.org/html/2607.28990#bib.bib46))。这些方法认识到最终奖励无法识别哪些中间动作推进了任务。然而,它们的信号通常依赖重复状态、树搜索、分段器、后见模型、反思或任务特定的步骤奖励,而非已执行科学分析所产生的证据。DiscoPO 则使用科学验证器为产生已验证分析证据的轮次授予信用,将轮次级 RL 与假设验证对齐。

## 3 问题定义

科学发现任务被定义为假设驱动的数据分析问题。给定一个数据集,任务是评估一个科学假设,产生统计发现,并用可执行的分析支持这些发现。设 U=\{u_j\}_{j=1}^{N} 表示此类任务的集合。每个任务表示为:

u_j = (h_j, d_j, v_j),  (1)

其中 h_j 指定假设或分析目标,d_j 是与任务关联的数据集,v_j 表示任务验证器。每个任务 u_j 与一个环境 e_j 配对,相应的环境集合为 E=\{e_j\}_{j=1}^{N}。环境暴露 h_j 和 d_j,在沙箱中执行智能体的动作,并返回观察结果,而任务内部的验证状态可能保持隐藏。因此,策略 π_θ 与环境 e_j 之间的交互可以建模为部分可观察马尔可夫决策过程(POMDP),产生轨迹 τ_j:

τ_j = (o_{j,0}, a_{j,1}, o_{j,1}, ..., a_{j,T_j}, o_{j,T_j}),  (2)

其中 o_{j,0} 包含初始任务观察,动作 a_{j,t} 可以是可执行分析或终端提交,观察 o_{j,t} 包含环境反馈。最终奖励仅为科学发现轨迹提供稀疏信用分配。它无法区分一条逐步积累证据的轨迹与一条恰好产生相同提交结果的单次捷径。设 r_{j,t} 表示分配给轮次 t 的过程奖励,衡量该轮次是否为任务发现贡献了可验证的进展。训练目标是最大化累积过程奖励:

R_j(τ_j) = ∑_{t=1}^{T_j} r_{j,t},  (3)

优化目标为:

J(θ) = E\left[R_j(τ_j)\right],  (4)

其中期望是对从 U 中采样的任务以及 π_θ 在其配对环境中生成的轨迹求得的。

## 4 方法

SciDisco 将第 3 (https://arxiv.org/html/2607.28990#S3) 节中的过程奖励形式转化为面向科学发现智能体的三阶段后训练流水线。SciThèque 将科学数据集编译为带沙箱的任务环境,并配有任务局部的隐藏证据 DAG。DAG 引导的轨迹合成利用这些环境为 SFT 冷启动产生可验证的多轮演示。DiscoPO 随后利用环境验证的科学进展的轮次级信用来优化策略。任务局部的隐藏证据 DAG 是这些阶段共享的接口:它定义了可以合成什么、在线交互期间什么算作可接受的转换,以及 RL 期间如何授予进展信用。

图 1 说明:SciDisco 的流水线:1) SciThèque 从科学数据集构建可扩展的数据–假设–验证器环境集合;2) 轨迹合成通过可执行分析原语遍历证据 DAG,并将被接受的状态转换保留为多轮 SFT 演示;3) DiscoPO 根据已验证 DAG 进展的增加来定义轮次级奖励,为产生证据的轮次分配信用。

### 4.1 SciThèque

SciThèque 实例化了第 3 (https://arxiv.org/html/2607.28990#S3) 节中定义的环境集合 E。它从源数据集和假设模板构建任务 u_j = (h_j, d_j, v_j),然后将每个任务挂载到沙箱运行时中以形成环境 e_j。智能体可以看到 h_j、数据文件 d_j 和观察结果 o_{j,t},而验证器逻辑、证据 DAG 和进展状态保持隐藏。附录 A (https://arxiv.org/html/2607.28990#A1) 报告了数据源分布和物化环境契约。

**目录构建。** SciThèque 首先构建候选数据集条目 c_i = (s_i, d_i, m_i, ρ_i),其中 s_i

相似文章

通过迭代元反射实现自主科学发现

Hugging Face Daily Papers

DiscoPER 是一个自主框架,利用大型语言模型和动态代码生成进行开放式科学研究,通过二阶元反射综合发现结果,并采用统计检验确保严谨性。在多模态生态基准测试中,它在恢复已知模式方面优于基线方法。

DSWorld:面向高效自主代理的数据科学世界模型

arXiv cs.AI

DSWorld 提出了一种数据科学世界模型,通过预测环境状态转换来减少自主代理中代价高昂的试错过程,在强化学习训练中实现了14倍加速,推理时加速3-6倍,同时保持了有竞争力的性能。

重新思考智能体时代的科学发现

arXiv cs.CL

本文介绍了SCION,一个智能体科学操作系统,它通过研究执行计划(REP)和分层多智能体执行,集成了AI工具用于科学发现。该系统在材料分析、分子设计和蛋白质筛选等应用中表现出色,超越了现有的自主研究智能体基线。

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。