基于难度适应的树结构策略优化以扩展RLVR中的推理覆盖
摘要
论文提出了DATPO,一种基于难度适应的树结构策略优化方法,通过句子熵引导的分支和多样性感知优化来增强大模型中的推理覆盖,在pass@k指标上优于基线方法。
查看缓存全文
缓存时间: 2026/09/10 06:11
论文页面 - 难度自适应树状策略优化以扩展强化学习推理覆盖范围
来源:https://huggingface.co/papers/2609.08650
摘要
DATPO 通过使用带有句子熵引导分支和多样性感知优化的难度自适应树状展开,提高了大型模型的推理覆盖范围。
基于可验证奖励的强化学习(RLVR (https://huggingface.co/papers?q=RLVR))是近期大型推理模型成功的关键。然而,尽管 RLVR (https://huggingface.co/papers?q=RLVR) 显著提高了单样本准确性,但由于训练过程中的探索有限,它往往无法扩展模型的内在推理覆盖范围(pass@k (https://huggingface.co/papers?q=pass%40k))。为解决此问题,我们优化了训练时展开的结构设计,以增强 pass@k (https://huggingface.co/papers?q=pass%40k)。我们的分析确定了三个关键设计原则:(1) 难度自适应展开 (https://huggingface.co/papers?q=difficulty-adaptive%20rollout) 在扩展 pass@k (https://huggingface.co/papers?q=pass%40k) 方面可以发挥重要作用,而不仅仅作为效率启发式方法;(2) 基于树的展开 (https://huggingface.co/papers?q=tree-based%20rollout) 在发现正确答案方面优于并行采样;(3) 句子熵引导的分叉 (https://huggingface.co/papers?q=sentence-entropy-guided%20forking) 克服了令牌级分支的局部化现象,以最大化语义多样性。基于这些见解,我们提出了 DATPO (https://huggingface.co/papers?q=DATPO)(难度自适应句子熵引导的树状策略优化)。DATPO (https://huggingface.co/papers?q=DATPO) 将难度自适应树搜索与兄弟节点多样性优势 (https://huggingface.co/papers?q=sibling-diversity%20advantage) 项相结合,在训练过程中明确促进语义多样性以扩展推理覆盖范围。在数学推理基准测试上的实验表明,DATPO (https://huggingface.co/papers?q=DATPO) 在 pass@k (https://huggingface.co/papers?q=pass%40k) 方面优于基线方法,这直接转化为更优的测试时缩放 (https://huggingface.co/papers?q=test-time%20scaling) 性能。
查看 arXiv 页面 (https://arxiv.org/abs/2609.08650) 查看 PDF (https://arxiv.org/pdf/2609.08650) GitHub0 (https://github.com/colin31472/DATPO) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08650)
在您的智能体中获取此论文:
hf papers read 2609\.08650
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.08650 以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.08650 以从此页面链接。
引用此论文的 Space0
无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.08650 以从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
面向多模态推理的结构化角色感知策略优化
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
HiDiffTIR:多轮工具集成推理的层次难度感知策略优化
提出HiDiffTIR,一种面向LLM代理中多轮工具集成推理的层次难度感知策略优化框架,通过细粒度信用分配提升性能和工具调用准确性。
AdaSR:基于分层相对策略优化的自适应流式推理
提出了AdaSR框架,使推理模型能够自适应地处理流式输入,以及HRPO(一种分层强化学习方法),用于优化思考分配,以实现准确性与效率的权衡。
GraphPO:面向推理模型的基于图策略优化
GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。