N-GRPO:嵌入级邻居混合以增强策略优化
摘要
N-GRPO 在 GRPO 框架中引入语义邻居混合,以增强数学推理多样性并保持语义一致性,在数学基准和分布外任务上均取得了提升。
查看缓存全文
缓存时间: 2026/06/12 02:52
论文页面 - N-GRPO: 嵌入级邻域混合用于增强策略优化
来源:https://huggingface.co/papers/2606.10768
摘要
N-GRPO 是一种在 GRPO 框架内创新的探索策略,通过语义邻域混合在保持语义一致性的同时注入多样性,从而增强大语言模型的数学推理能力。
大语言模型(https://huggingface.co/papers?q=Large%20Language%20Models)在数学推理(https://huggingface.co/papers?q=mathematical%20reasoning)上的成功高度依赖于在展开阶段(https://huggingface.co/papers?q=rollout%20phase)生成多样且有效的解题路径。然而,当前的展开技术面临一个基本权衡:词元级采样(https://huggingface.co/papers?q=token-level%20sampling)通常生成冗余轨迹(仅措辞不同),而使用随机噪声的嵌入级方法(https://huggingface.co/papers?q=embedding-level%20methods)又经常破坏语义一致性。为解决这一问题,我们提出 N-GRPO——一种集成到群体相对策略优化(https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO)框架中的新颖探索策略。我们的方法不依赖词元级采样或原生嵌入级噪声,而是利用语义邻域混合(https://huggingface.co/papers?q=Semantic%20Neighbor%20Mixing)。该机制通过混合锚点词元及其最近语义邻域的嵌入来动态构建输入表示,从而在严格遵循局部语义流形的同时注入多样性。在 DeepSeek-R1-Distill-Qwen 系列不同规模模型上的实验评估表明,N-GRPO 不仅在数学推理基准(https://huggingface.co/papers?q=math%20reasoning%20benchmarks)上相较强基线取得一致改进,而且在分布外任务(https://huggingface.co/papers?q=out-of-distribution%20tasks)上也展现出稳健的泛化能力。
查看 arXiv 页面(https://arxiv.org/abs/2606.10768)查看 PDF(https://arxiv.org/pdf/2606.10768)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.10768)
在您的Agent中获取此论文:
hf papers read 2606.10768
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
暂无链接此论文的模型
请在模型 README.md 中引用 arxiv.org/abs/2606.10768,以便从本页链接到它。
引用该论文的数据集0
暂无链接此论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2606.10768,以便从本页链接到它。
引用该论文的Spaces0
暂无链接此论文的Space
请在 Space README.md 中引用 arxiv.org/abs/2606.10768,以便从本页链接到它。
包含此论文的收藏集0
暂无包含此论文的收藏集
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,以便从本页链接到它。
相似文章
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
组熵控制策略优化
本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。
F-GRPO: 分解式组相对策略优化用于统一候选生成与排序
F-GRPO 提出了一种分解式组相对策略优化框架,将候选生成与排序统一在单个自回归LLM中,解决了信用分配问题,并在序列推荐和多跳问答基准上提升了顶级性能。