YFPO:基于神经元引导奖励的耦合特征偏好优化在数学推理中的初步研究
摘要
本文介绍了 YFPO,这是一种神经元引导的偏好优化框架,利用内部激活信号来提高大型语言模型在数学推理方面的能力。
arXiv:2605.11906v1 公告类型:新文章
摘要:偏好优化已成为提升大型语言模型推理能力的重要训练后范式。现有方法通常依赖于外部构建的偏好数据,使用偏好和非偏好响应作为样本级别的监督信号。然而,这些外部信号很少明确利用模型内部表示中包含的能力相关信息。在数学推理方面,某些神经元组可能展现出与数学知识、符号操作或逻辑推理相关的激活模式。类似于反射性行为信号,这些内部激活可能粗略地指示模型是否正在调用与数学相关的功能。我们引入了 YFPO(耦合特征偏好优化),这是一个用于数学推理的初步神经元引导偏好优化框架。YFPO 首先使用 AttnLRP 识别与数学相关的神经元,然后基于偏好和非偏好响应之间的激活差值构建辅助奖励。这种设计通过内部神经元级别的信号增强了外部偏好学习。我们在使用 GSM8K 作为主要基准的小规模语言模型上进行了初步实验。结果表明,神经元级别的信号可以与偏好优化相互作用,并偶尔提升推理性能,为更细粒度且可解释的推理导向训练后优化提供了有希望的方向。
查看缓存全文
缓存时间: 2026/05/13 06:20
# YFPO:一种基于神经元引导奖励的数学推理耦合特征偏好优化初步研究
来源: https://arxiv.org/html/2605.11906
###### 摘要
偏好优化已成为提升大语言模型推理能力的重要后训练范式。现有方法通常依赖外部构建的偏好数据,使用优选(preferred)和非优选(dispreferred)响应作为样本级监督信号。然而,此类外部信号很少明确利用模型内部表示中蕴含的与能力相关的信息。对于数学推理而言,某些神经元组可能表现出与数学知识、符号操作或逻辑推理相关的激活模式。类似于反射性行为信号,这些内部激活可能为模型是否正在调动数学相关能力提供粗略指示。我们提出了 **YFPO**(**Y**oked **F**eature **P**reference **O**ptimization,耦合特征偏好优化),这是一种用于数学推理的初步神经元引导偏好优化框架。YFPO 首先使用 AttnLRP 识别与数学相关的神经元,然后基于优选和非优选响应之间这些神经元的激活边际构建辅助奖励。该设计将外部偏好学习与内部神经元级信号相结合。我们在小规模语言模型上以 GSM8K 为主要基准进行了初步实验。结果表明,神经元级信号可以与偏好优化相互作用,并偶尔能提升推理性能,为更细粒度和可解释的推理导向后训练提供了一个有前景的方向。
YFPO:一种基于神经元引导奖励的数学推理耦合特征偏好优化初步研究
Yifan Le††thanks: 通讯作者\. 浙江大学 leyifan@zju\.edu\.cn
参见图注 Figure 1: YFPO 概览\. 在离线阶段,使用 AttnLRP 识别一组固定的前 $K$ 个与数学相关的神经元\. 在偏好优化期间,YFPO 从这些神经元中提取优选和非优选响应的激活值,构建神经元奖励边际,并将其与 DPO 目标结合\.
## 1 引言
大语言模型(LLMs)在数学推理、复杂问题求解和指令遵循方面展现出了强大的能力,但这些能力通常需要通过后训练进一步激发和对齐\. 监督微调教会模型任务格式和基本响应模式,而偏好优化则通过比较不同响应的质量并鼓励更符合人类偏好或任务目标的输出,从而改善模型行为\. 从基于 PPO 的 RLHF \[Schulman et al., 2017; Stiennon et al., 2020; Ouyang et al., 2022\] 到直接偏好优化算法如 DPO、IPO、KTO、ORPO 和 SimPO \[Rafailov et al., 2023; Azar et al., 2023; Ethayarajh et al., 2024; Hong et al., 2024; Meng et al., 2024\],近期方法使偏好优化成为后训练 LLMs 的重要途径\. 在数学推理中,偏好优化和强化学习可以利用最终答案的正确性、过程监督、验证器或优选/拒绝响应,以鼓励更可靠的推理轨迹和最终答案 \[Cobbe et al., 2021; Lightman et al., 2023; Shao et al., 2024; Yu et al., 2025\]\.
然而,现有的偏好优化方法主要依赖模型外部构建的监督信号\. 无论信号来自人类偏好、奖励模型、基于规则的验证器还是基于答案的偏好对,其本质都是告诉模型哪个输出更好\. 这种样本级监督是有效的,但通常不会明确考虑在生成这些输出时模型内部发生的变化\. 换言之,模型被优化以偏好选定的响应,而训练目标很少使用与特定能力相关的内部计算信号\. 对于依赖符号操作、多步推导和逻辑组合的数学推理而言,与能力相关的内部表示可能为偏好优化提供额外信息\.
与此同时,越来越多的可解释性工作表明,LLMs 在神经元或电路层面存在功能结构\. 先前的研究已识别出与事实知识、语言行为、任务模式或推理过程相关的神经元或神经元组 \[Dai et al., 2022; Tang et al., 2024\]\. 多语言神经元研究表明,不同语言可能对应不同的激活模式,而基于相关性的分析和干预进一步表明,仅凭激活相关性不足以确立功能重要性\. 这些发现意味着,神经元级的内部信号不仅有助于解释模型行为,还可能为训练提供更细粒度的指导\.
受此观察的启发,我们研究了一个自然的问题:如果模型包含与数学推理相关的神经元级信号,这些信号能否作为外部偏好信号的补充引入偏好优化中?我们并不假设所选神经元完全表征了数学能力\. 相反,我们将它们视为与数学推理行为相关的内部统计信号\. 偏好优化天然包含优选/拒绝的比较结构,这为比较高质量和低质量推理响应在内部神经元信号上是否存在差异提供了便捷的接口\. 本文探讨与数学相关的神经元激活能否与外部偏好数据相互作用,并影响偏好学习过程\.
为此,我们提出了 YFPO,这是一种用于数学推理的神经元引导偏好优化框架\. YFPO 首先识别与数学推理相关的神经元,然后在偏好优化过程中基于这些神经元的激活构建辅助奖励\. 与主要使用外部优选/拒绝响应的标准 DPO 类方法不同,YFPO 在样本级偏好监督之外引入了内部能力相关信号\. 具体而言,YFPO 并不替换原始的偏好优化目标,而是添加一个神经元奖励作为辅助项,使模型在外部偏好监督和内部数学相关引导下进行训练\.
我们将 YFPO 定位为神经元引导偏好优化的初步研究,重点关注内部神经元信号与偏好学习目标之间的相互作用\. 我们的目标并非声称神经元信号可以替代外部偏好数据,而是探索此类内部信号是否能为推理导向的偏好优化提供额外信息\. 我们在小规模语言模型上使用数学偏好数据进行了初步实验,并分析了最终任务准确率、神经元奖励趋势以及优选-拒绝奖励边际\.
图1提供了所提框架的概览\. YFPO 包含两个阶段\. 在离线阶段,我们使用 AttnLRP 在数学推理样本上估计神经元级相关性,并选择一组固定的前 $K$ 个与数学相关的神经元\. 在训练阶段,通过前向钩子(forward hooks)访问这些选定的神经元,计算优选和非优选响应的激活得分\. 得到的神经元奖励边际随后与 DPO 目标结合,使外部偏好监督和内部神经元级信号共同塑造优化过程\.
我们的主要贡献有三点\. 首先,我们将神经元引导的偏好公式化为一个研究问题,探讨内部数学相关神经元信号能否补充外部偏好数据\. 其次,我们提出了 YFPO,它将数学相关神经元的激活转化为辅助奖励,并与 DPO 风格的偏好目标相结合\. 第三,我们在小规模数学推理设定下进行了初步实验,分析了神经元奖励如何与偏好优化相互作用,为更细粒度和可解释的推理导向后训练迈出了初步步伐\.
## 2 相关工作
#### 偏好优化\.
偏好优化已成为 LLM 后训练的核心技术\. 早期的 RLHF 流程通常依赖奖励模型和 PPO 风格的强化学习,根据人类偏好改进模型输出 \[Schulman et al., 2017; Stiennon et al., 2020; Ouyang et al., 2022\]\. 尽管有效,但这些方法涉及复杂的训练流程,需要大量的计算资源和超参数调整\. 为了简化这一过程,近期工作提出了直接偏好优化方法,如 DPO、IPO、KTO、ORPO 和 SimPO \[Rafailov et al., 2023; Azar et al., 2023; Ethayarajh et al., 2024; Hong et al., 2024; Meng et al., 2024\]\. 这些方法通常从优选/拒绝响应或类似偏好的标签构建样本级目标,而不明确训练单独的奖励模型\. 总体而言,现有的偏好优化方法主要使用外部构建的偏好数据来告诉模型哪个答案更好\. 相比之下,我们的工作研究了与数学推理相关的内部神经元信号能否在偏好优化期间作为辅助指导\.
#### 面向推理的偏好优化\.
偏好优化和强化学习也被广泛应用于改善数学推理\. 与一般对齐任务相比,数学推理通常提供更清晰的反馈来源,如最终答案的正确性、过程正确性或基于验证器的验证 \[Cobbe et al., 2021; Lightman et al., 2023\]\. 因此,面向推理的后训练方法通常使用结果奖励、过程奖励、自动验证器或偏好数据来优化模型策略\. 例如,DeepSeekMath 中的 GRPO 和 DAPO 表明,强化学习风格的后训练可以显著影响复杂推理行为 \[Shao et al., 2024; Yu et al., 2025\]\. 然而,大多数这些方法仍然从模型外部推导优化信号,很少明确考虑在推理期间调用了哪些内部计算组件\. YFPO 通过将数学相关神经元激活引入偏好优化,探索了一个互补的方向\.
#### 神经元级可解释性\.
可解释性研究长期以来一直致力于理解 LLM 中的内部表示和计算机制\. 先前的工作使用特征归因、探测、激活统计和神经元干预来识别与事实知识、语言能力或特定任务行为相关的神经元 \[Sundararajan et al., 2017; Belinkov, 2022; Dai et al., 2022\]\. 例如,Knowledge Neurons 研究了与事实知识相关的神经元,而 LAPE 分析了多语言 LLM 中的语言选择性神经元 \[Dai et al., 2022; Tang et al., 2024\]\. AttnLRP 将逐层相关性传播扩展到 Transformer 模型,并实现了对潜在表示的高效归因 \[Achtibat et al., 2024\]\. 受这一系列工作的启发,我们将神经元级信号不仅视为解释模型行为的工具,也视为可以参与训练的潜在信号\. 具体而言,YFPO 在偏好优化中将数学相关神经元信号引入为辅助奖励,将内部能力表示与外部偏好学习联系起来\.
## 3 方法
我们提出了 YFPO,这是一种用于数学推理的神经元引导偏好优化方法\. 其核心思想是利用与数学推理相关的内部神经元信号作为辅助奖励,以补充由优选和非优选响应提供的外部偏好信号\.
整体流程包含两个阶段\. 在第一阶段,我们在数学推理数据上离线使用 AttnLRP 识别与数学相关的神经元,并选择相关性得分最高的前 $K$ 个神经元\. 在第二阶段,在 DPO 训练期间,我们使用前向钩子提取这些神经元在优选和非优选响应上的激活,并构建神经元奖励边际\. 然后,YFPO 将此边际作为辅助项添加到 DPO 目标中,鼓励模型在学习外部偏好的同时,也接受内部数学相关信号的引导\.
### 3.1 识别与数学相关的神经元
我们首先识别一组与数学推理行为相关的神经元\. 遵循 CRANE \[Le and Li, 2026\] 中使用的基于相关性的神经元选择程序,我们采用 AttnLRP \[Achtibat et al., 2024\] 来估计数学推理样本上的神经元级贡献\. 给定一个数学问题及其推理答案,AttnLRP 将输出 token 的相关性通过 Transformer 模块反向传播,根据其对数学推理输出的贡献分配中间 MLP 神经元的相关性得分\.
我们将 Transformer MLP 中的每个中间通道视为一个神经元\. 具体而言,对于每个 MLP 层,我们关注 `down_proj` 之前的中间激活维度\. 因此,一个神经元由层索引 $l$ 和神经元索引 $j$ 指定\. 对于第 $l$ 层中的第 $j$ 个神经元,我们聚合其在数学样本和响应 token 上的相关性:
$$
r_{l,j} = \mathbb{E}_{x,y,t}\left[\left|R_{l,j,t}(x,y)\right|\right],
$$
其中 $R_{l,j,t}$ 表示在响应 token $t$ 处分配给神经元 $(l,j)$ 的相关性\. 我们使用绝对相关值,因为我们关注的是神经元对数学推理输出的贡献强度,而不是其贡献的符号\.
基于聚合的相关性得分,我们选择前 $K$ 个神经元作为与数学相关的神经元集,记为 $\mathcal{N}_{\text{math}}$\. 除非另有说明,我们设置 $K=1024$\. 所选的神经元集在偏好优化期间保持固定,并且相似文章
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
GraphPO:面向推理模型的基于图策略优化
GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。
选择性优势熵自适应范围GRPO:用于语言模型高效强化学习的非对称令牌级折扣
本文介绍了GRPO的自适应范围和选择性优势变体,这些变体使用基于熵的令牌级折扣来稳定训练并提高数学推理任务的性能,以更低的方差实现了更强的结果。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
SocraticPO:通过交互式指导的策略优化
SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。