CDRL:认证驱动的强化学习用于中微子味模型发现
摘要
本文提出了一种名为CDRL(认证驱动强化学习)的框架,该框架利用符号推理生成可重用约束,以改进组合搜索空间中的强化学习,并在中微子味模型发现中得到验证,有效模型率和效率均有所提高。
arXiv:2608.20686v1 公告类型:新
摘要:许多科学发现问题需要在复杂领域约束下搜索组合假设空间。强化学习(RL)提供了一种有前景的方法,但现有方法依赖标量奖励,这些奖励提供的信息有限,无法解释候选解决方案为何失败,导致智能体反复探索无效区域。我们引入了认证驱动强化学习(CDRL),这是一个利用符号推理工具的结构化反馈的框架。当候选方案违反领域约束时,这些工具会生成证书,识别导致失败的操作。CDRL将这些证书转换为可重用约束,消除无效解的类别,并引导探索朝向有效区域。我们在理论粒子物理的中微子味模型发现中评估CDRL,其中假设空间超过$10^{26}$个可能模型,并将其与之前用于此任务的最先进RL方法进行比较。在三个理论空间中,CDRL实现了高达1.95$\times$的有效模型率提升和高达6.33$\times$的中微子模型率提升,同时评估的候选方案减少了多达4$\times$。我们进一步使用事后决策树框架从搜索轨迹中提取40条可解释规则,并表明将这些规则作为软约束重用,在所有三个理论空间中,有效模型率提升高达2$\times$,中微子模型发现提升高达3$\times$。这些结果表明,CDRL揭示了组合搜索空间中的可重用结构,并为科学模型发现提供了一个通用框架。
查看缓存全文
缓存时间: 2026/08/24 04:20
# CDRL:面向中微子味模型发现的认证驱动强化学习
来源:https://arxiv.org/html/2608.20686
Jake Rudolph
所属机构:美国加州大学欧文分校
Victoria Knapp\-Pérez
所属机构:美国加州大学欧文分校
所属机构:美国Halluminate研究部
\[2pt\]piyush\.jha@gatech\.edu, jirudolp@uci\.edu, vknapppe@uci\.edu,mfieg@fnal\.gov, aishikghosh@physics\.gatech\.edu, vganesh@gatech\.edu
Max Fieg
所属机构:美国费米实验室粒子理论部
Aishik Ghosh
所属机构:美国佐治亚理工学院物理学院
所属机构:美国劳伦斯伯克利国家实验室
Vijay Ganesh
\[4pt\]
计算机科学学院
佐治亚理工学院
美国
###### 摘要
许多科学发现问题需要在复杂领域约束下搜索组合假设空间。强化学习(RL)提供了一种有前景的方法,但现有方法依赖标量奖励,这些奖励仅能提供关于候选解决方案失败原因的有限信息,导致智能体反复探索无效区域。我们引入了认证驱动强化学习(CDRL),这是一种利用符号推理工具结构化反馈的框架。当候选方案违反领域约束时,这些工具会生成标识失败相关行为的认证证书。CDRL将这些证书转化为可重用的约束条件,以消除无效解决方案类别并引导探索指向有效区域。我们在理论粒子物理中的中微子味模型发现任务上评估了CDRL,其中假设空间超过10^{26}个可能模型,并将其与此前用于此任务的最先进RL方法进行比较。在三个理论空间中,CDRL实现了高达1.95倍的有效模型率提升和高达6.33倍的中微子模型率提升,同时评估的候选方案数量减少了多达4倍。我们进一步使用事后决策树框架从搜索轨迹中提取了40条可解释规则,并表明将它们作为软约束重用可在所有三个理论空间中实现高达2倍的有效模型率提升和3倍的中微子模型发现率提升。这些结果表明,CDRL揭示了组合搜索空间中可重用的结构,并为科学模型发现提供了通用框架。
## 1 引言
科学发现通常需要探索大量候选假设空间。研究人员提出数学模型,推导预测结果,并将其与实验观测进行比较。这一迭代过程是许多科学学科的核心,包括粒子物理[^12]、[^26]、[^7]、[^21],计算生物学[^42],化学[^61]以及材料科学[^10]。在许多此类设定中,候选模型空间是组合式的,模型结构的微小变化可能导致预测结果的显著差异。因此,系统性地探索这些大型理论空间成为一项重大计算挑战,这促使了能够辅助科学发现与探索的AI系统的发展[^53]、[^1]、[^49]。
探索大型假设空间的一种常见方法是强化学习(RL)[^65],它将发现过程构建为一个序贯决策问题。在这些框架中,智能体逐步构建候选模型,并根据其是否满足特定领域标准获得奖励。RL已成功应用于自动定理证明[^46]、程序合成[^71]和科学发现[^67]、[^50]、[^31]。然而,这些方法通常依赖标量奖励信号,这些信号未能提供关于候选方案为何失败的太多信息[^39]。因此,智能体常常浪费大量精力反复探索组合搜索空间中类似的无效区域。
在许多科学领域,除了标量奖励外,还存在结构化反馈,但传统RL算法并未充分利用它。定理证明器、约束求解器、计算机代数系统、程序分析工具和模拟器等外部推理工具可以分析候选解决方案并识别失败原因。因为这些系统作用于形式定义的对象,它们通常可以生成**证书**^A,描述其分析结果并精确定位违反约束的组件。此类证书提供了结构化信息,比单独的标量奖励信号更有效地指导探索。关键是,这两种信号是互补而非竞争的(图2[^20])。此外,科学家传统上能够从问题解决过程中提炼有用的启发式规则,这些见解可以加速未来对底层数学空间的探索。因此,一种能够从智能体的决策中提取此类启发式规则的RL方法将极具价值,既有助于提高可解释性,也能提升后续运行的计算效率。
人们对于使用RL构建粒子物理理论的兴趣日益增长[^68]、[^12]、[^6]、[^29]。一个可行的理论或模型需要满足诸多一致性检验,例如要求洛伦兹不变性及其它内部对称性得到保持,同时要求理论再现某些观测到的性质,如特定粒子的质量。当RL智能体尝试构建模型时,它通常会通不过这些检验。然而,如果RL智能体能获得关于候选模型失败情况的证书形式反馈,它就能被训练得更快构建出可行模型。为展示完全整合此类反馈的潜在优势,我们考虑了可以为中微子质量构建的模型[^12],这使得物理学家能够在直觉有限的情况下快速探索数学模型。在我们的设定中,智能体选择模型的粒子内容及其必须满足的对称性。这些约束通过对称群的不可约表示进行编码,得到定义量子场论的拉格朗日密度。生成的模型使用现有的符号和数值软件进行拉格朗日构建、质量矩阵提取和参数拟合,随后与实验数据进行统计比较。对超过10^{26}个可能模型进行详尽搜索是不可行的,因为评估单个候选模型就需要进行复杂的符号和数值计算。
**认证驱动强化学习(CDRL)**是一个框架,它利用外部推理工具的结构化反馈来改进在受约束组合搜索空间中的探索。当候选方案违反领域约束时,推理工具返回一个证书,标识导致失败的赋值子集。CDRL分析该证书,并将负责的赋值转换为符号冲突子句,该子句被添加到全局SAT约束数据库[^15]中。在搜索过程中,这些学习到的约束由一个轻量级符号推理层强制执行,该层立即消除违反已知领域规则的部分候选方案,使RL智能体能够避免探索搜索空间中不可能的区域。在随后的MCTS展开过程中[^62]、[^63],该符号推理层通过布尔约束传播(BCP)[^20]、[^15]实现,当智能体构建新候选方案时强制执行累积的子句,阻止任何重复先前已见冲突决策模式的部分赋值被探索。这与负奖励在**性质**上而非性质程度上有所不同。负奖励是一个标量,通过小的梯度步骤调整网络权重;它降低决策的**概率**但永远无法完全排除该决策,因此智能体能够并且实际上确实会多次重新访问相同的死胡同,而惩罚并未说明**哪个**决策应被归咎。冲突子句则直接作用于搜索空间本身:它是一个硬逻辑约束,命名了负责的具体赋值,一旦添加,BCP会使包含该模式的每个部分赋值对于所有共享该子句数据库的智能体都**不可达**,且不依赖于网络训练得有多好。实际上,标量奖励改变了智能体**偏好**去哪里,而证书改变了它**能**去哪里。随着更多证书的累积,可行搜索空间被逐步修剪,使智能体能够避免重新发现等效的失败模式,并将昂贵的物理评估集中在更可能包含有效理论的区域。
在我们的设定中,作为结构化反馈的一个具体例子,考虑一个候选中微子模型,其非阿贝尔A_{4}表示赋值对于**任何**Z_{N}电荷选择都是无效的(图1[^11])。我们的系统不会仅为此候选方案发出一个标量惩罚,而是提取一个**证书**来标识负责的表示模式,并将其编译成一个逻辑约束,该约束在整个电荷扇区中阻止该模式,因此当它在搜索树中的其他地方再次出现时,会立即被屏蔽,无需运行任何物理评估(详见第4节[^34])。
具体而言,我们使用成熟的工具实现此循环:候选模型被编码为合取范式中的布尔可满足性(SAT)公式;证书成为在搜索期间通过布尔约束传播(BCP)[^20]、[^15]执行的**冲突子句**,这是现代SAT求解器[^15]内部使用的单元传播机制;搜索本身是由策略-值网络引导的AlphaZero风格的蒙特卡洛树搜索(MCTS)[^62]、[^63]。这三个组件在每个决策中扮演着不同且互补的角色:神经指导**提议**下一个赋值,符号推理**修剪**已被证书否决的赋值,而MCTS在剩余部分上**平衡**探索与利用。
我们在三个中微子理论空间上实证量化了这种结构化反馈的收益(第5节[^35]),并进一步证明CDRL累积的约束和决策模式揭示了理论空间中可重用的结构(第5.4节[^33])。在三个用于中微子味模型发现的理论空间中,CDRL实现了高达1.95倍的有效模型率提升和高达6.33倍的中微子模型率提升,相较于此前用于此任务的AMBer方法[^12],同时评估的候选方案数量减少了多达4倍。这些收益预计会随着问题复杂性的增加而扩大,并表明对底层组合假设空间的导航效率大幅提高,其精神类似于算法发现和基于搜索的科学推理方面的最新进展[^25]、[^60]、[^49]、[^1]。
除了提高搜索效率外,CDRL还能从搜索轨迹中发现搜索知识。通过对高置信度MCTS状态的事后决策树分析,我们提取了40条可解释规则,这些规则捕捉了粒子赋值之间重复出现的依赖关系。将这些规则作为约束重用进一步提高了性能,表明它们捕捉了理论空间中有意义且可重用的结构。因此,我们的贡献包括:(i)CDRL,一个证书驱动的RL框架,它将符号失败证书转换为可重用的搜索约束,逐步消除大型无效区域;(ii)在中微子味模型发现方面取得了最先进的结果,以更少的评估实现了显著更高的发现率,超越了此前的最佳方法。相似文章
Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training
The paper introduces CD-RFT, a method to decouple the shared control bottleneck in RL post-training by regularizing a novel control coefficient, improving multi-task capability on models like Qwen2.5-7B and Llama-3.2-3B.
解锁不可解难题:教师引导的课程学习实现数据高效RLVR
本文介绍了一种教师引导的课程学习方法,用于强化学习与可验证奖励(RLVR),以高效训练语言模型处理初始不可解的数学问题,实现显著的数据效率并扩展推理边界。
面向长程语言智能体可验证强化学习的策略条件化反事实信用
提出了CVT-RL,一种带有策略条件化反事实贡献估计和可验证奖励的约束策略梯度算法,提高了长程语言智能体的可靠性并减少了奖励篡改。
面向回合级智能体强化学习的科学发现环境扩展
本文介绍了SciDisco,一个可扩展的框架,用于通过过程可验证环境、基于DAG的轨迹合成和回合级强化学习来训练科学发现智能体。所提出的SciDisco-14B模型在假设驱动的科学数据分析基准上达到了最先进水平。
叛逆的学生:通过自蒸馏 RLVR 反转教师信号以进行推理探索
本文介绍了 RLRT,这是一种在自蒸馏过程中反转教师信号的方法,旨在强化学生模型成功的偏离行为,从而增强大语言模型的推理探索能力。