意外成功与重复失败:用于大语言模型推理中探索的熵引导信用分配

Hugging Face Daily Papers 论文

摘要

本文提出了熵优势策略优化(EAPO),一种用于大语言模型强化学习的熵引导信用分配方法,该方法不对称地处理成功与失败,以增强探索并在推理任务上实现更优性能。

可验证奖励的强化学习(RLVR)通过结果级反馈增强了大语言模型(LLMs)的推理能力,然而近期更细粒度的信用分配方法通常需要辅助模型、额外采样或特权信息。尽管策略熵提供了一个现成的信号,但在强化和惩罚下优先处理不确定位置,会将惩罚集中在失败响应仍有恢复替代方案的地方,这可能会抑制探索机会。为了解决这一问题,我们提出了熵优势策略优化(EAPO),一种熵引导的信用分配方法,它不对称地处理成功与失败。具体而言,受不确定条件下成功不易重复而自信失败往往重现的观察启发,EAPO将归一化策略熵与响应优势的符号相结合,以强化意外成功并纠正重复失败。它对成功响应中的高熵决策给予更强的强化,对失败响应中的低熵决策给予更强的惩罚,同时减弱不确定位置的惩罚以保留恢复机会。通过跨token重新分配响应优势,EAPO直接从现有的rollout信号中推导token级信用,无需额外监督。我们在一系列基础和推理骨干网络的推理任务上验证了EAPO,证明它实现了最佳的整体性能。我们进一步表明,EAPO促进了更有效的探索,拓宽了问题覆盖范围并生成了更多样化的候选答案。
查看原文
查看缓存全文

缓存时间: 2026/09/29 04:08

论文页面 - 意外成功与反复失败:面向大语言模型推理探索的熵引导信用分配

来源:https://huggingface.co/papers/2609.33781

摘要

基于可验证奖励的强化学习(RLVR)通过结果层面反馈提升了大语言模型(LLMs)的推理能力,然而近期针对细粒度信用分配的研究往往需要辅助模型、额外采样或特权信息。虽然策略熵提供了现成的信号,但在强化和惩罚阶段同时优先处理不确定位置会将惩罚集中在失败响应中仍有恢复机会的选项上,这可能抑制探索机会。为此,我们提出熵优势策略优化(EAPO)——一种不对称处理成功与失败的熵引导信用分配方法。具体而言,基于“不确定条件下的成功较难重复,而自信的失败往往反复出现”这一观察,EAPO 将归一化策略熵与响应优势的符号相关联,以强化意外成功并纠正反复失败。该方法为成功响应中的高熵决策分配更强的强化,为失败响应中的低熵决策分配更强的惩罚,同时削弱不确定位置的惩罚以保留恢复机会。通过重新分配响应优势至各个词元,EAPO 直接从现有生成信号中派生词元级信用,无需额外监督。我们在基于基础模型和推理模型的多种推理任务上验证了 EAPO,结果表明其取得了最佳的整体性能。我们进一步证明 EAPO 促进了更有效的探索,拓宽了问题覆盖范围并生成了更多样化的候选答案。

查看 arXiv 页面 (https://arxiv.org/abs/2609.33781)查看 PDF (https://arxiv.org/pdf/2609.33781)项目页面 (https://eapo-explore.github.io/)GitHub (https://github.com/wgcyeo/EAPO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.33781)

在您的代理中获取此论文:

hf papers read 2609\.33781

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2609.33781 以从本页链接。

引用本文的数据集 0

无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.33781 以从本页链接。

引用本文的 Spaces 0

无 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.33781 以从本页链接。

包含本文的合集 0

无合集包含本文

将此论文添加到合集 (https://huggingface.co/new-collection)以从本页链接。

相似文章