BODHI:LLM是否会分支并发现异质推理?

arXiv cs.CL 论文

摘要

本文研究了经过RLVR训练的LLM是否会分支以发现异质推理,通过迷宫求解实验和BODHI-Trees表明,策略熵坍缩伴随着语义分支熵的减少,从而限制了展开(rollout)的多样性。

arXiv:2608.02867v1 公告类型:新 摘要:尽管基于可验证奖励的强化学习(RLVR)已提升了大型语言模型(LLM)在各种推理任务上的表现,但关于RLVR是扩展了推理能力边界,还是仅仅提高了采样效率,仍存在重大争议。本文通过受控的迷宫求解实验,并基于语义等价性从数学推理轨迹中提取树结构(BODHI-Trees),研究了经RLVR训练的LLM在测试时探索的性质。这有助于我们区分由风格变化产生的熵与真正的推理分支产生的熵。我们的研究结果表明,在RLVR模型中观察到的策略熵坍缩不仅仅是句法层面的,还伴随着语义分支熵的显著降低。虽然RLVR提高了对环境约束的遵守和回溯能力,但它压缩了后续延续的空间;我们提供的证据表明,这可能是RLVR样本效率提升的原因,但代价是真正的展开(rollout)多样性。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# BODHI:大语言模型是否会分支并发现异质推理?
来源:https://arxiv.org/html/2608.02867
Soumadeep Saha†\dagger,Krish Sharma†\dagger,Akshay Chaturvedi\*,Nicholas Asher†\dagger
†\daggerANITI,图卢兹大学;\*LINAGORA 实验室
通讯作者:soumadeep\.saha97@gmail\.com

###### 摘要

尽管带可验证奖励的强化学习(RLVR)在多种推理任务上提升了大语言模型(LLM)的性能,但关于 RLVR 是扩展了推理能力边界,还是仅仅提升了采样效率,仍存在重大争议。在本文中,我们通过受控迷宫求解实验,并基于语义等价性从数学推理轨迹中提取树结构(BODHI-树),来研究经过 RLVR 训练的 LLM 在测试时进行探索的性质。这有助于我们区分由风格变化引起的熵与真正的推理分支。我们的研究发现:RLVR 模型中观察到的策略熵坍缩并不仅仅是句法层面的,还伴随着语义分支熵的显著降低。虽然 RLVR 改善了对环境约束的遵循和回溯能力,但它压缩了续写的空间;我们提供的证据表明,这可能正是 RLVR 在采样效率上获益的原因,尽管其代价是真正的展开多样性。

BODHI:大语言模型是否会分支并发现异质推理?
Soumadeep Saha†\dagger, Krish Sharma†\dagger, Akshay Chaturvedi\*,Nicholas Asher†\dagger
†\daggerANITI,图卢兹大学;\*LINAGORA 实验室
通讯作者:soumadeep\.saha97@gmail\.com

## 1 引言

参见图注
图1:数学推理树的构建。我们首先将推理轨迹分割为推理节点链,然后基于语义相似性合并这些节点。更多细节见附录A(https://arxiv.org/html/2608.02867#A1)。111所有相关工件可在espressovi\.github\.io/BODHI(https://espressovi.github.io/BODHI)获取。

最近几篇论文指出了一个在*带可验证奖励的强化学习*(RLVR)训练的大语言模型(LLM)中出现的奇特问题。这些模型似乎并不能“发现”超出基础模型的新能力,探索性较弱,并且依赖少数高熵 token 来驱动推理多样性(Chen et al.,2026a (https://arxiv.org/html/2608.02867#bib.bib4); Saha et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib28); Wang et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib34); Yue et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib42))。一个具备访问大量*有效的、语义不同的*续写能力的探索型模型显然是可取的——它能够实现新的解决方案、增加多样性,甚至可以通过自洽性(self-consistency)(Wang et al.,2023 (https://arxiv.org/html/2608.02867#bib.bib35))、思维树(tree-of-thought)(Yao et al.,2023 (https://arxiv.org/html/2608.02867#bib.bib39))等技术实现性能扩展。然而,同样清楚的是,*并非所有探索都是可取的*。例如,一个 LLM 如果能够产生大量*有效的续写*,即正确的数学推理轨迹,但这些续写仅在浅层方面有所不同,例如变量命名、交换律运算顺序或自然语言(NL)表述中的细微句法差异,那么这并不构成有意义的探索,因为它未能遍历根本不同的推理路径,也未产生新颖的解题策略。这引出了我们研究的核心主张:*大语言模型是否会分支并发现异质推理*,还是说这种探索在很大程度上只是装饰性的?为此,我们在本研究中提出三个研究问题:

⋄\diamond RQ1:RLVR 是否会限制测试时探索,并对某些轨迹表现出更强的偏好?
⋄\diamond RQ2:如果是这样,这种策略集中仅仅是句法/风格层面的吗?
⋄\diamond RQ3:RLVR 引发的策略转变与性能之间有何关联?

令人惊讶的是,尽管最近许多论文从根本上增进了我们对 RL 训练动态的理解,特别是在防止策略坍缩、鼓励探索等方面(Yu et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib40); Liu et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib22); Li et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib21); Yang et al.,2025b (https://arxiv.org/html/2608.02867#bib.bib38); Zhao et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib43)),一个基本问题仍然研究不足:*RLVR 如何改变对语义不同推理续写的偏好*。我们通过两种模态来研究 LLM 中的探索:迷宫,其中探索的概念相当直接;以及数学推理,由于所使用的数学和语言表达的复杂性,探索的概念远不那么直接。为了研究数学推理中的探索,我们通过将一个问题对应的大量备选轨迹折叠成树结构(BODHI-树,见图1 (https://arxiv.org/html/2608.02867#S1.F1))来具体化探索的概念,其中每个节点代表若干语义相同的推理轨迹,其不同的子节点代表概念上不同的续写,从而可以对探索的性质进行细粒度分析。

我们工作的核心贡献如下:
(i) 使用我们的 BODHI-树数据集和迷宫,我们证明了 RL 训练产生的策略在分支行为上表现出坍缩;
(ii) 熵的坍缩*不仅仅是句法层面的*,RLVR 训练的模型也表现出*语义分支偏好熵的显著坍缩*;
(iii) 此外,我们提供的证据表明,*RLVR 通过压缩无效续写和有效的、语义不同的续写这两者的可达状态空间来驱动性能*。此外,在本研究过程中,我们创建并开源了多个完全可复现的中间后训练检查点(以及数据集和代码),以帮助未来的 RLVR 动态研究。

## 2 背景

*RLVR* 将下一 token 预测重新表述为马尔可夫决策过程,学习一个策略 πθ\pi_\{\theta\} 来预测下一 token oio_i,从而生成状态轨迹 [输入]→[输入,o1]→...→[输入,o1,...oT][\textrm{Input}]\rightarrow[\textrm{Input},o_\{1\}]\rightarrow\ldots\rightarrow[\textrm{Input},o_\{1\},\ldots o_\{T\}],以最大化来自确定性验证器的期望奖励。这一范式显著提升了多个推理和规划基准上的整体性能,并推动了诸如工具集成和*智能体*(agentic)应用等能力的前沿。它还催生了一种辅助技术,称为*Long-CoT 蒸馏*,或简称为*蒸馏*(Guo et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib9); Shao et al.,2024 (https://arxiv.org/html/2608.02867#bib.bib30)),其中 LLM 在由能力更强的 RL 训练的“教师”LLM 生成的轨迹上进行微调(SFT)。给定一个状态 sts_t,续写集合——所有以 sts_t 为前缀的有限字符串——可以被划分为若干“*验证器等价*”的类别。然而,由于验证器通常只评估终止状态的最后几个 token(Shao et al.,2024 (https://arxiv.org/html/2608.02867#bib.bib30); Guo et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib9); Yu et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib40); Liu et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib22)),验证器等价并不能直接映射到语义等价。例如,一个表面合理但恰好给出正确答案的续写,其效用与一个语义正确的续写相同,并且事先无法保证验证器等价但语义多样的续写具有同等的实现倾向(Anschel et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib1))。这正是我们研究的核心分析对象:*不同验证器等价轨迹的可达性*222即,验证器等价的(有限)续写的不同概率。在测试时,我们将这一性质称为**探索**。这不同于*轨迹间探索*(inter-trace exploration)(Jiang et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib18)),它提出的是反事实问题:*还有哪些其他续写是可能的?* 测试时探索揭示了“推理能力”边界(Yue et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib42)),因为如果模型能够访问多样化的轨迹,那么在给定足够多样本的情况下,它就会得出新颖的解题方法或技术。因此,RL 训练有效性的试金石就是其探索能力。此外,借助思维树(tree-of-thought)(Yao et al.,2023 (https://arxiv.org/html/2608.02867#bib.bib39))等辅助集成技术,探索还可以放大性能。

随着 RL 训练的 LLM 的普及,理解*奖励信号对模型生成策略的影响*变得至关重要,尤其是因为 RLVR 始终激励语义多样且有意义的探索这一假设已受到广泛质疑(Saha et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib28); Wang et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib34); Yue et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib42); Anschel et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib1))。Yue et al. (2025 (https://arxiv.org/html/2608.02867#bib.bib42)) 声称 RL 训练的 LLM 在 pass@k\textrm{pass}@k 扩展上有所退化,并且不能发现超出基础 LLM 的根本性新颖推理路径。Saha et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib28)) 提出 RL 训练的模型与蒸馏模型相比“过度自信”:它们的策略熵较低,这与性能下降相关。类似地,Wang et al. (2025 (https://arxiv.org/html/2608.02867#bib.bib34)) 证明 RL 策略依赖少数(∼20%\sim 20\%)高熵“分叉 token”来驱动测试时的有意义的探索(Cheng et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib6)),而 Jang et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib17)) 将这种坍缩归因于“在少数结构关键决策点上的过度自信”。然而,Yuan et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib41)) 反对将高 k 的 pass@k\textrm{pass}@k 性能下降视为推理多样性下降的迹象。他们将 RLVR 探索坍缩类比为“过训练”,并提出对策略更新进行重新加权,以偏向低成功率 rollout 组。Cai et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib3)) 做出了类似的诊断,并推进了“边界感知”课程学习以增强推理能力前沿。Huang et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib15)) 则认为 token 级统计不能反映推理在多 token 语义结构上的进展。这场争论凸显了一个关键空白:*现有的基于性能和 token 级的指标无法表明熵坍缩是否意味着推理多样性的缺乏*。

RL 训练期间策略熵的坍缩已受到广泛关注,最近几篇论文提出了对标准 RL 训练方案的修改。基于蒙特卡洛树搜索的算法(Li et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib21); Yang et al.,2025b (https://arxiv.org/html/2608.02867#bib.bib38); Zheng et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib44))在训练期间以树状结构采样 rollout,并分配片段级(segment-level)信用。其他技术则显式地加入基于 rollout 组属性的提示来增强探索(Chen et al.,2026a (https://arxiv.org/html/2608.02867#bib.bib4))。诸如基于出现频率(Anschel et al.,2025 (https://arxiv.org/html/2608.02867#bib.bib1))、嵌入相似性(Zhao et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib43))、来自辅助模型的反馈(Mishra et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib23); Hu et al.,2026a (https://arxiv.org/html/2608.02867#bib.bib13))以及许多其他方法(Li and Li,2026 (https://arxiv.org/html/2608.02867#bib.bib20); He et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib11); Cai et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib3); Hu et al.,2026b (https://arxiv.org/html/2608.02867#bib.bib14); Jang et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib17); Yuan et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib41); Huang et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib15); Chen et al.,2026b (https://arxiv.org/html/2608.02867#bib.bib5))都已被提出,并取得了不同程度的成功(Zhao et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib43); Hao et al.,2026 (https://arxiv.org/html/2608.02867#bib.bib10))。Hao et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib10)) 研究了影响训练期间熵坍缩的因素,并强调最近的方法依赖于对这些因素中的一部分进行启发式调整,从而限制了其有效性。在相关研究中,Jin et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib19)) 研究了模型性能与训练熵之间的关系,发现它们存在负相关但任务依赖。Wen et al. (2026 (https://arxiv.org/html/2608.02867#bib.bib36)) 使用*LLM 作为评判者*框架来评估中间轨迹正确性(CoT-pass@k\textrm{pass}@k)以及答案,证明 RLVR 训练的模型与基础模型相比具有更高的轨迹有效性。CoT-pass@k\textrm{pass}@k 在数学推理任务上的扩展结果好坏参半,作者推测*“蒸馏后的 LLM 可能已经掌握了可以通过 RLVR 学习的主要推理能力”*,这进一步凸显了将 RLVR 后训练对测试时探索的影响分离出来的必要性。Jiang et al. (2025 (https://arxiv.org/html/2608.02867#bib.bib18)) 引入了 LCoT2Tree,它通过将推理轨迹的片段映射到提取出的高层摘要,将 Long CoT 轨迹解析为树。通过分类片段功能(例如,验证、探索、回溯),他们识别出诸如过度分支等结构性错误模式。我们的工作不是仅仅关注 token 级指标或性能,而是试图衡量 RLVR 如何改变对语义不同推理续写的偏好,并试图确定熵坍缩是否仅仅是策略对句法和风格更强偏好的产物,抑或模型在语义多样的验证器等价续写方面也存在固化的偏好。

## 3 方法论:测量探索

在本节中,我们概述*探测数据集*的构建,这些数据集使我们能够区分不同 LLM 在探索方面的策略差异。虽然自然语言数学推理直接衡量 LLM 的逻辑能力,但它本质上是有噪声的;巨大的语言状态空间允许模型生成表面的重述或不同的句法表述,这些表述模仿了多样性,但并不代表真正的推理分支。因此,我们采用

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

Cross-LLM推理一致性:来自共享交互的证据

arXiv cs.AI

本文利用基于交互的解释方法,研究了不同LLM在预测相同词元时是否共享共同的推理模式。结果表明,先进LLM展现出一致的交互模式,暗示它们隐式地优化到了共享的推理机制。