意外成功与重复失败:用于大语言模型推理中探索的熵引导信用分配
摘要
本文提出了熵优势策略优化(EAPO),一种用于大语言模型强化学习的熵引导信用分配方法,该方法不对称地处理成功与失败,以增强探索并在推理任务上实现更优性能。
查看缓存全文
缓存时间: 2026/09/29 04:08
论文页面 - 意外成功与反复失败:面向大语言模型推理探索的熵引导信用分配
来源:https://huggingface.co/papers/2609.33781
摘要
基于可验证奖励的强化学习(RLVR)通过结果层面反馈提升了大语言模型(LLMs)的推理能力,然而近期针对细粒度信用分配的研究往往需要辅助模型、额外采样或特权信息。虽然策略熵提供了现成的信号,但在强化和惩罚阶段同时优先处理不确定位置会将惩罚集中在失败响应中仍有恢复机会的选项上,这可能抑制探索机会。为此,我们提出熵优势策略优化(EAPO)——一种不对称处理成功与失败的熵引导信用分配方法。具体而言,基于“不确定条件下的成功较难重复,而自信的失败往往反复出现”这一观察,EAPO 将归一化策略熵与响应优势的符号相关联,以强化意外成功并纠正反复失败。该方法为成功响应中的高熵决策分配更强的强化,为失败响应中的低熵决策分配更强的惩罚,同时削弱不确定位置的惩罚以保留恢复机会。通过重新分配响应优势至各个词元,EAPO 直接从现有生成信号中派生词元级信用,无需额外监督。我们在基于基础模型和推理模型的多种推理任务上验证了 EAPO,结果表明其取得了最佳的整体性能。我们进一步证明 EAPO 促进了更有效的探索,拓宽了问题覆盖范围并生成了更多样化的候选答案。
查看 arXiv 页面 (https://arxiv.org/abs/2609.33781)查看 PDF (https://arxiv.org/pdf/2609.33781)项目页面 (https://eapo-explore.github.io/)GitHub (https://github.com/wgcyeo/EAPO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33781)
在您的代理中获取此论文:
hf papers read 2609\.33781
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2609.33781 以从本页链接。
引用本文的数据集 0
无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.33781 以从本页链接。
引用本文的 Spaces 0
无 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.33781 以从本页链接。
包含本文的合集 0
无合集包含本文
将此论文添加到合集 (https://huggingface.co/new-collection)以从本页链接。
相似文章
ACPO:基于细粒度替代熵的自适应信用策略优化
介绍了ACPO,一种用于大型语言模型强化学习的token级信用分配框架,利用细粒度替代熵提升数学和编码基准的推理性能,优于DAPO、GTPO、SAPO等强基线。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。
重新审视熵正则化:自适应系数释放其在LLM强化学习中的潜力
本文提出自适应熵正则化(AER)框架,通过难度感知的系数分配和初始锚定目标熵来动态平衡LLM强化学习中的探索与利用,解决策略熵坍缩问题。在数学推理基准上的实验验证了该方法在准确性和探索能力上的一致性改进。
ERR+: 顺序熵解析:提升大型语言模型推理的效率与决断力
本文提出ERR+,一个两阶段强化学习框架,通过奖励思考阶段的熵下降来改进LLM推理,从而在多个数据集上提升准确性和效率。
打破自回归诅咒:动态认知熵编排的可擦除强化学习用于LLMs
本文提出E³RL,一种使用动态认知熵阈值的强化学习方法,使LLMs能够在生成过程中切除局部逻辑缺陷,克服长程推理中的自回归诅咒,并在AIME等数学推理基准上取得最先进的结果。