利用超组相对策略优化推动生物分子效用-多样性前沿
摘要
本文介绍了 SGRPO,这是一种策略优化框架,通过结合集合级多样性奖励和效用来提升生物分子的生成能力。它在小分子和蛋白质设计等任务中展示了改进的效用-多样性权衡。
查看缓存全文
缓存时间: 2026/05/12 07:33
论文页面 - 使用超组相对策略优化推动生物分子效用-多样性前沿
来源:https://huggingface.co/papers/2605.08659
摘要
SGRPO 是一种策略优化框架,通过直接引入集合级(set-level)多样性奖励来增强生物分子生成能力,从而在多个设计任务中同时提升效用和多样性。
生物分子生成器(https://huggingface.co/papers?q=Biomolecular%20generators)通常通过奖励反馈(https://huggingface.co/papers?q=reward%20feedback)进行调整以提高特定任务的效用,但仅追求效用往往会使生成结果集中在狭窄的候选家族中。由于样本多样性是一种集合级属性,保持多样性颇具挑战。我们引入了超组相对策略优化(https://huggingface.co/papers?q=Supergroup%20Relative%20Policy%20Optimization)(SGRPO (https://huggingface.co/papers?q=GRPO)),这是一种灵活的 GRPO (https://huggingface.co/papers?q=GRPO) 风格框架,可直接从集合级多样性(https://huggingface.co/papers?q=set-level%20diversity)构建奖励。对于每种条件,SGRPO (https://huggingface.co/papers?q=GRPO) 采样一组候选集合的“超组”(supergroup),在相同条件下比较它们的多样性,并通过留一法(leave-one-out)多样性贡献将群体多样性奖励重新分配给各个 rollout,然后再与 rollout 级效用相结合。这种设计使 SGRPO (https://huggingface.co/papers?q=GRPO) 独立于特定的生成器、效用奖励或多样性度量,允许实例化为不同的 GRPO (https://huggingface.co/papers?q=GRPO) 风格方法。我们在从头小分子设计(https://huggingface.co/papers?q=de%20novo%20small-molecule%20design)、基于口袋的小分子设计(https://huggingface.co/papers?q=pocket-based%20small-molecule%20design)和从头蛋白质设计(https://huggingface.co/papers?q=de%20novo%20protein%20design)上评估了 SGRPO (https://huggingface.co/papers?q=GRPO),并将其实例化为基于 GRPO (https://huggingface.co/papers?q=GRPO) 和 Coupled-GRPO (https://huggingface.co/papers?q=GRPO) 的自回归生成器和离散扩散生成器(https://huggingface.co/papers?q=discrete%20diffusion%20generators)。在多次解码扫描中,SGRPO (https://huggingface.co/papers?q=GRPO) 扩展了效用-多样性帕累托前沿,并在适用情况下,相对于预训练生成器、GRPO (https://huggingface.co/papers?q=GRPO) 和记忆辅助 GRPO (https://huggingface.co/papers?q=GRPO) 取得了最佳的帕累托前沿级别指标。我们的分析进一步表明,直接的集合级多样性(https://huggingface.co/papers?q=set-level%20diversity)奖励在小群体中仍然有效,并有助于在训练后保留更广泛的生成分布覆盖。代码发布于 https://github.com/IDEA-XL/SGRPO (https://huggingface.co/papers?q=GRPO)。
查看 arXiv 页面 (https://arxiv.org/abs/2605.08659) 查看 PDF (https://arxiv.org/pdf/2605.08659) GitHub1 (https://github.com/IDEA-XL/SGRPO) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.08659)
在您的智能体中获取此论文:
hf papers read 2605\.08659
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.08659 以从此页面建立链接。
引用此论文的数据集 0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.08659 以从此页面建立链接。
引用此论文的空间(Spaces) 0
没有链接此论文的空间(Space)
在空间(Space) README.md 中引用 arxiv.org/abs/2605.08659 以从此页面建立链接。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此文添加到收藏集(https://huggingface.co/new-collection)以从此页面建立链接。
相似文章
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
组熵控制策略优化
本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。
F-GRPO: 分解式组相对策略优化用于统一候选生成与排序
F-GRPO 提出了一种分解式组相对策略优化框架,将候选生成与排序统一在单个自回归LLM中,解决了信用分配问题,并在序列推荐和多跳问答基准上提升了顶级性能。
Active-GRPO:用于分子优化的自适应模仿与自我改进推理
Active-GRPO 引入了一个自适应模仿与自我改进推理框架,能够动态决定何时模仿参考、何时强化模型自身的发现以进行分子优化,在 TOMG-Bench-MolOpt 基准上取得了相较于先前方法具有统计显著性的改进。