CrystalGRPO:面向流基晶体结构预测的目标对齐与覆盖保持强化学习
摘要
介绍了CrystalGRPO,一个用于流基晶体结构预测的强化学习后训练框架,它对齐目标恢复并保持候选覆盖,在MP-20和MPTS-52基准上提升了Top-1和Top-20性能。
arXiv:2608.06582v1 公告类型:新
摘要:基于流的生成模型可以高效地为晶体结构预测(CSP)生成候选结构,但其预训练目标并不直接优化下游的目标恢复。强化学习后训练提供了一种灵活的解决方案,但现有方法主要依赖能量奖励和仅坐标的随机策略。预测能量不能识别参考多晶型物,而奖励驱动的集中化会减少Top-N恢复所需的候选覆盖。我们引入了CrystalGRPO,一个CSP对齐的后训练框架,将现有的ODE到SDE策略构造扩展到坐标-晶格联合状态。CrystalGRPO结合了MACE预测能量与基于StructureMatcher的恢复分数,并提供两种操作模式:CrystalGRPO-Q,优先考虑单次采样恢复;以及CrystalGRPO-C,结合全轨迹参考正则化与覆盖感知的组优势,以保留有限预算下的目标恢复。在MP-20和MPTS-52上,使用PXRDGen和OMatG骨干网络,两种变体在所有四种骨干-数据集设置中,相对于仅坐标强化,均降低了一次和二十次采样的RMSE。CrystalGRPO-Q一致地提高了Top-1,而CrystalGRPO-C在所有设置中实现了更高的Top-20。
查看缓存全文
缓存时间: 2026/08/10 08:02
# CrystalGRPO:基于流的晶体结构预测中的目标对齐与覆盖保持强化学习 来源:https://arxiv.org/html/2608.06582 Kaixiang Su\(^1\),Hongfei Xue\(^1,\)*,Qiang Zhu\(^2,3,\)* \(^1\)Department of Computer Science, University of North Carolina at Charlotte \(^2\)Department of Mechanical Engineering and Engineering Science, University of North Carolina at Charlotte \(^3\)North Carolina Battery Complexity, Autonomous Vehicle and Electrification \(BATT CAVE\) Research Center Charlotte, NC 28223, USA [email protected], [email protected], [email protected] *通讯作者 ###### 摘要 基于流的生成模型能够高效地为晶体结构预测(CSP)生成候选结构,但其预训练目标并不直接优化下游目标恢复。强化学习后训练提供了一种灵活的解决方案,但现有方法主要依赖能量奖励和仅坐标的随机策略。预测能量无法识别参考多晶型,而奖励驱动的集中化可能降低Top-N恢复所需的候选覆盖。我们提出CrystalGRPO,一个面向CSP对齐的后训练框架,将现有的ODE到SDE策略构建扩展到坐标-晶格联合状态。CrystalGRPO结合了MACE预测能量与基于StructureMatcher的恢复分数,并提供两种运行模式:CrystalGRPO-Q优先考虑单次采样恢复;CrystalGRPO-C将全轨迹参考正则化与覆盖感知的组优势相结合,以在有限预算内保持目标恢复。在MP-20和MPTS-52上使用PXRDGen和OMatG骨干网络的实验中,两种变体在所有四种骨干网络-数据集设置下均相对于仅坐标强化学习降低了一次和二十样本的RMSE。CrystalGRPO-Q持续改进Top-1,而CrystalGRPO-C在所有设置下均实现了更高的Top-20。 ## 1 引言 晶体结构预测[18 (https://arxiv.org/html/2608.06582#bib.bib9)](CSP)旨在从化学组成和实验观测中恢复晶体的晶格与原子排列[13 (https://arxiv.org/html/2608.06582#bib.bib16)]。在实践中,生成式CSP模型充当提案引擎:它应产生一组紧凑的候选结构,供后续通过更高保真度的计算或实验精修进行验证[20 (https://arxiv.org/html/2608.06582#bib.bib27)]。因此,我们将CSP视为有预算限制的目标恢复问题,其中单候选精度和有限候选预算下的目标覆盖都至关重要。 参见图1说明:在晶体结构预测中,预测能量无法唯一识别目标多晶型。该示意图根据预测的相对能量和与参考结构的结构位移来放置随机采样轨迹的端点。从潜在噪声出发的采样轨迹可能终止于参考匹配的能量盆地(蓝色)、有效的低能非目标盆地(红色),或无效或扭曲的高能区域(灰色)。由于非目标多晶型可能被赋予比参考
相似文章
LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距
本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。
Packora: 生成式分子晶体结构预测的系统设计
Packora 是一种基于流的生成模型,用于分子晶体结构预测,它从分子图中联合预测原子坐标和晶格,在生成和排名基准测试中超越了基线。
LithoGRPO:基于GRPO强化流匹配的快速逆光刻
LithoGRPO引入了一个新颖的框架,将流匹配与基于GRPO的强化学习相结合,用于快速且高质量的逆光刻掩模优化,在保持高效生成的同时实现了最先进的性能。
Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习
提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。
Active-GRPO:用于分子优化的自适应模仿与自我改进推理
Active-GRPO 引入了一个自适应模仿与自我改进推理框架,能够动态决定何时模仿参考、何时强化模型自身的发现以进行分子优化,在 TOMG-Bench-MolOpt 基准上取得了相较于先前方法具有统计显著性的改进。