N-GRPO:嵌入级邻居混合以增强策略优化

Hugging Face Daily Papers 论文

摘要

N-GRPO 在 GRPO 框架中引入语义邻居混合,以增强数学推理多样性并保持语义一致性,在数学基准和分布外任务上均取得了提升。

大型语言模型在数学推理中的成功很大程度上依赖于在生成阶段生成多样且有效的解题路径。然而,当前的生成技术面临一个基本权衡:词元级采样常常产生仅因复述而不同的冗余轨迹,而利用随机噪声的嵌入级方法则经常破坏语义一致性。为了解决这一问题,我们提出了 N-GRPO,一种集成到组相对策略优化(GRPO)框架中的新型探索策略。我们的方法不依赖于词元级采样或原生嵌入级噪声,而是利用语义邻居混合机制。该机制通过混合锚点词元及其最近语义邻居的嵌入,动态构建输入表示,从而在严格遵循局部语义流形的同时注入多样性。在不同规模的 DeepSeek-R1-Distill-Qwen 模型上的实验评估表明,N-GRPO 不仅在数学推理基准上对强基线取得了一致的改进,而且在分布外任务上也展现出鲁棒的泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/06/12 02:52

论文页面 - N-GRPO: 嵌入级邻域混合用于增强策略优化

来源:https://huggingface.co/papers/2606.10768

摘要

N-GRPO 是一种在 GRPO 框架内创新的探索策略,通过语义邻域混合在保持语义一致性的同时注入多样性,从而增强大语言模型的数学推理能力。

大语言模型(https://huggingface.co/papers?q=Large%20Language%20Models)在数学推理(https://huggingface.co/papers?q=mathematical%20reasoning)上的成功高度依赖于在展开阶段(https://huggingface.co/papers?q=rollout%20phase)生成多样且有效的解题路径。然而,当前的展开技术面临一个基本权衡:词元级采样(https://huggingface.co/papers?q=token-level%20sampling)通常生成冗余轨迹(仅措辞不同),而使用随机噪声的嵌入级方法(https://huggingface.co/papers?q=embedding-level%20methods)又经常破坏语义一致性。为解决这一问题,我们提出 N-GRPO——一种集成到群体相对策略优化(https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO)框架中的新颖探索策略。我们的方法不依赖词元级采样或原生嵌入级噪声,而是利用语义邻域混合(https://huggingface.co/papers?q=Semantic%20Neighbor%20Mixing)。该机制通过混合锚点词元及其最近语义邻域的嵌入来动态构建输入表示,从而在严格遵循局部语义流形的同时注入多样性。在 DeepSeek-R1-Distill-Qwen 系列不同规模模型上的实验评估表明,N-GRPO 不仅在数学推理基准(https://huggingface.co/papers?q=math%20reasoning%20benchmarks)上相较强基线取得一致改进,而且在分布外任务(https://huggingface.co/papers?q=out-of-distribution%20tasks)上也展现出稳健的泛化能力。

查看 arXiv 页面(https://arxiv.org/abs/2606.10768)查看 PDF(https://arxiv.org/pdf/2606.10768)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.10768)

在您的Agent中获取此论文:

hf papers read 2606.10768

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

暂无链接此论文的模型

请在模型 README.md 中引用 arxiv.org/abs/2606.10768,以便从本页链接到它。

引用该论文的数据集0

暂无链接此论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2606.10768,以便从本页链接到它。

引用该论文的Spaces0

暂无链接此论文的Space

请在 Space README.md 中引用 arxiv.org/abs/2606.10768,以便从本页链接到它。

包含此论文的收藏集0

暂无包含此论文的收藏集

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中,以便从本页链接到它。

相似文章

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。

组熵控制策略优化

Hugging Face Daily Papers

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。