乱码也有效:提示空间扰动拓宽推理探索

Hugging Face Daily Papers 论文

摘要

本文介绍了 LoPE,这是一种利用提示空间扰动来解决可验证奖励强化学习中“零优势问题”的训练框架,从而增强大语言模型的推理探索能力。

基于可验证奖励的强化学习,特别是组相对策略优化(GRPO),显著提升了大语言模型(LLMs)的推理能力。然而,在处理复杂任务时,GRPO 经常遭遇“零优势问题”:当针对某个查询的所有采样轨迹均失败时,相对优势会坍缩为零。因此,模型无法从这些问题中获得有效的训练信号,导致训练数据和计算预算的浪费。虽然简单地增加这些问题的采样预算是一种常见的补救措施,但静态采样策略本质上限制了推理探索,从而降低了成功率。在本文中,我们提出了用于探索的 Lorem 扰动(LoPE),这是一个简单而有效的训练框架,旨在打破这一探索瓶颈。我们假设,与任务无关的提示空间扰动能够足以改变模型的输出分布,从而为难题解锁正交的推理路径。具体而言,LoPE 在重新采样之前,将随机从 Lorem Ipsum 词汇表(一种伪拉丁语占位符文本)中组装的序列添加到提示的前面。在 17 亿、40 亿和 70 亿参数模型上的实验表明,LoPE 显著优于使用原始提示进行重新采样。进一步的分析表明,其他低困惑度的基于拉丁文的随机序列也是有效的扰动。我们的研究结果确立了 LoPE 作为拓宽大语言模型强化学习探索能力的强基线。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:15

论文页面 - 无意义文本也有用:提示空间扰动拓宽推理探索

来源:https://huggingface.co/papers/2605.05566

摘要

LoPE 通过利用Lorem Ipsum扰动来增强大语言模型训练中的探索能力,从而解决了可验证奖励强化学习中的零优势问题。

带有可验证奖励的强化学习(https://huggingface.co/papers?q=Reinforcement%20learning),特别是组相对策略优化(Group Relative Policy Optimization,https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization)(GRPO),显著提升了大语言模型(Large Language Models,https://huggingface.co/papers?q=Large%20Language%20Models)(LLMs)的推理能力。然而,在复杂任务中,GRPO 经常受到``零优势问题(https://huggingface.co/papers?q=zero-advantage%20problem)’’的困扰:当针对某个查询的所有采样轨迹均失败时,相对优势会坍塌为零。因此,模型在这些问题上失去了有效的训练信号,导致训练数据和计算预算的浪费。虽然简单地增加这些问题的采样预算是一种常见的补救措施,但静态采样策略本质上限制了推理探索,从而限制了成功率。在本文中,我们提出了用于探索的Lorem扰动(Lorem Perturbation for Exploration,LoPE),这是一个简单而有效的训练框架,旨在打破这一探索瓶颈。我们认为,与任务无关的提示空间扰动(prompt-space perturbations,https://huggingface.co/papers?q=prompt-space%20perturbations)能够足够地改变模型的输出分布,从而为难题解锁正交的推理路径。具体而言,LoPE 在重新采样(resampling,https://huggingface.co/papers?q=resampling)之前,将随机组装自Lorem Ipsum(https://huggingface.co/papers?q=Lorem%20Ipsum)词汇(一种伪拉丁语占位符文本)的序列前置到提示词中。在 1.7B、4B 和 7B 模型上的实验表明,LoPE 显著优于使用原始提示词的重新采样(resampling,https://huggingface.co/papers?q=resampling)。进一步的分析显示,其他具有低困惑度(perplexity,https://huggingface.co/papers?q=perplexity)的基于拉丁语随机序列也是有效的扰动。我们的结果确立了 LoPE 作为拓宽 LLM 强化学习(reinforcement learning,https://huggingface.co/papers?q=reinforcement%20learning)探索能力的强大基线。

查看 arXiv 页面 (https://arxiv.org/abs/2605.05566)查看 PDF (https://arxiv.org/pdf/2605.05566)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.05566)

在您的智能体中获取此论文:

hf papers read 2605\.05566

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.05566 以从本页进行链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.05566 以从本页进行链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.05566 以从本页进行链接。

包含此论文的 Collection0

没有 Collection 包含此论文

将此论文添加到 collection (https://huggingface.co/new-collection) 以从本页进行链接。

相似文章

提示驱动探索

arXiv cs.LG

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。

OPERA: 通过基于目标困惑度的强化学习对齐开放式推理

arXiv cs.CL

OPERA提出了一种针对开放式任务的强化学习方法,利用困惑度动态作为内在奖励,取代了不可靠的“LLM作为评判者”奖励模型。在Qwen3-8B上实现了最先进的结果,在创意写作及其他开放式任务中可媲美专有模型。

SPS:通过概率挤压引导实现大语言模型强化学习中的更优探索

arXiv cs.CL

研究人员提出了 SPS(概率挤压引导),这是一种结合强化学习与逆强化学习的训练范式,旨在解决大语言模型推理训练中的概率挤压问题。该问题表现为概率质量过度集中于高奖励轨迹,导致探索空间受限及多样本性能(Pass@k)下降。在五个推理基准上的实验表明,该方法有效提升了模型的探索能力与 Pass@k 指标。