基于难度适应的树结构策略优化以扩展RLVR中的推理覆盖

Hugging Face Daily Papers 论文

摘要

论文提出了DATPO,一种基于难度适应的树结构策略优化方法,通过句子熵引导的分支和多样性感知优化来增强大模型中的推理覆盖,在pass@k指标上优于基线方法。

可验证奖励的强化学习(RLVR)一直是大型推理模型近期成功的核心。然而,虽然RLVR显著提高了单样本准确率,但由于训练期间探索有限,它往往无法扩展模型的内在推理覆盖(pass@k)。为了解决这个问题,我们优化了训练时rollout的结构设计以增强pass@k。我们的分析确定了三个关键设计原则:(1)难度适应的rollout在扩展pass@k方面可以发挥重要作用,而不仅仅是作为效率启发式;(2)基于树的rollout在发现正确答案方面优于并行采样;以及(3)句子熵引导的分支克服了token级分支的局部化现象,以最大化语义多样性。基于这些见解,我们提出了DATPO(基于难度适应的句子熵引导的树结构策略优化)。DATPO将难度适应的树搜索与兄弟多样性优势项相结合,显式促进语义多样性,以在训练期间扩展推理覆盖。在数学推理基准上的实验表明,DATPO在pass@k上优于基线方法,这直接转化为更优的测试时缩放性能。
查看原文
查看缓存全文

缓存时间: 2026/09/10 06:11

论文页面 - 难度自适应树状策略优化以扩展强化学习推理覆盖范围

来源:https://huggingface.co/papers/2609.08650

摘要

DATPO 通过使用带有句子熵引导分支和多样性感知优化的难度自适应树状展开,提高了大型模型的推理覆盖范围。

基于可验证奖励的强化学习(RLVR (https://huggingface.co/papers?q=RLVR))是近期大型推理模型成功的关键。然而,尽管 RLVR (https://huggingface.co/papers?q=RLVR) 显著提高了单样本准确性,但由于训练过程中的探索有限,它往往无法扩展模型的内在推理覆盖范围(pass@k (https://huggingface.co/papers?q=pass%40k))。为解决此问题,我们优化了训练时展开的结构设计,以增强 pass@k (https://huggingface.co/papers?q=pass%40k)。我们的分析确定了三个关键设计原则:(1) 难度自适应展开 (https://huggingface.co/papers?q=difficulty-adaptive%20rollout) 在扩展 pass@k (https://huggingface.co/papers?q=pass%40k) 方面可以发挥重要作用,而不仅仅作为效率启发式方法;(2) 基于树的展开 (https://huggingface.co/papers?q=tree-based%20rollout) 在发现正确答案方面优于并行采样;(3) 句子熵引导的分叉 (https://huggingface.co/papers?q=sentence-entropy-guided%20forking) 克服了令牌级分支的局部化现象,以最大化语义多样性。基于这些见解,我们提出了 DATPO (https://huggingface.co/papers?q=DATPO)(难度自适应句子熵引导的树状策略优化)。DATPO (https://huggingface.co/papers?q=DATPO) 将难度自适应树搜索与兄弟节点多样性优势 (https://huggingface.co/papers?q=sibling-diversity%20advantage) 项相结合,在训练过程中明确促进语义多样性以扩展推理覆盖范围。在数学推理基准测试上的实验表明,DATPO (https://huggingface.co/papers?q=DATPO) 在 pass@k (https://huggingface.co/papers?q=pass%40k) 方面优于基线方法,这直接转化为更优的测试时缩放 (https://huggingface.co/papers?q=test-time%20scaling) 性能。

查看 arXiv 页面 (https://arxiv.org/abs/2609.08650) 查看 PDF (https://arxiv.org/pdf/2609.08650) GitHub0 (https://github.com/colin31472/DATPO) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.08650)

在您的智能体中获取此论文:

hf papers read 2609\.08650

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.08650 以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.08650 以从此页面链接。

引用此论文的 Space0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.08650 以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

面向多模态推理的结构化角色感知策略优化

arXiv cs.AI

本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。

SLPO:通过代理策略扩展潜在推理

Hugging Face Daily Papers

介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。

GraphPO:面向推理模型的基于图策略优化

arXiv cs.CL

GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。