SocraticPO:通过交互式指导的策略优化

arXiv cs.LG 论文

摘要

SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。

arXiv:2606.09887v1 公告类型:新 摘要:面向大语言模型的强化学习(RL)通常使用标量结果奖励(如二元正确性)来监督推理过程。这种奖励提供了优化方向,但很少解释模型应如何修正其错误推理,这可能会鼓励捷径学习和脆弱的策略。我们提出\textbf{SocraticPO}(Socratic Policy Optimization,苏格拉底策略优化),这是一个策略优化框架,通过苏格拉底式的自然语言指导增强强化学习的展开过程。在展开过程中,学生首先独立作答;如果答案错误,教师诊断其尝试并提供简洁的纠正性指导,之后学生在扩展的上下文下继续推理。关键在于,这种指导与奖励衰减配对:在教师干预后获得的正确答案仅获得衰减后的奖励,防止策略将教师帮助视为获取奖励的免费途径。由于SocraticPO仅修改展开过程,而保留标准期望奖励目标不变,因此它可插入现有的策略梯度后端(如Reinforce++)。此外,由于教师仅提供文本层面的指导,SocraticPO可以利用更强的黑盒教师模型,无需访问logits或进行分布匹配。在SciKnowEval的本科级别科学推理基准上,SocraticPO优于强RL和自蒸馏基线。消融实验表明,目标性指导和奖励衰减两者缺一不可,其中奖励衰减减轻了对辅助纠正的依赖。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:16

# SocraticPO:基于交互式引导的策略优化
来源:https://arxiv.org/html/2606.09887

\\correspondence Zirui Liu\\frontsup1, Jie Ouyang\\frontsup1, Qi Liu\\frontsup1\\corrauthor, Xianquan Wang\\frontsup1, Jiayu Liu\\frontsup1, Tingyue Pan\\frontsup1, Qingchuan Li\\frontsup1, Jing Sha\\frontsup2, Zhenya Huang\\frontsup1, Shijin Wang\\frontsup2, Enhong Chen\\frontsup1

\\affilsup1State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China
\\affilsup2iFLYTEK AI Research (Central China), iFLYTEK Co., Ltd

[email protected] (https://arxiv.org/html/2606.09887v1/mailto:[email protected])

###### 摘要

针对大语言模型的强化学习通常使用标量结果奖励(如二元正确性)来监督推理过程。这类奖励提供了优化方向,但很少解释模型应如何修正其错误的推理,这可能导致捷径学习和脆弱的策略。我们提出 **SocraticPO**(Socratic Policy Optimization,苏格拉底式策略优化),这是一种策略优化框架,通过在强化学习 rollout 过程中补充苏格拉底式的自然语言引导来实现优化。在 rollout 过程中,学生首先独立作答;如果答案错误,教师诊断其尝试并提供简洁的纠正性指导,然后学生在扩展的上下文下继续推理。关键是,这种指导与奖励衰减配对:在教师干预后获得的正确答案只能获得衰减后的奖励,从而防止策略将教师帮助视为获得奖励的免费途径。由于 SocraticPO 仅修改了 rollout 过程,而保留了标准期望奖励目标不变,因此它可以被嵌入到现有的策略梯度后端(如 Reinforce++)中。此外,由于教师仅提供文本级的指导,SocraticPO 可以利用更强的黑盒教师模型,而无需访问 logits 或进行分布匹配。在来自 SciKnowEval 的本科级科学推理基准测试上,SocraticPO 相比强 RL 和自蒸馏基线有所改进。消融实验表明,有针对性的指导与奖励衰减两者都是必要的,其中奖励衰减减轻了对辅助纠正的依赖。

参见图1:SocraticPO 概述。传统的 RL rollout 仅在学生回答后提供标量结果反馈,而 SocraticPO 在失败尝试后插入条件性的教师指导。

## 1 引言

大语言模型(LLM)凭借 Transformer 架构、规模扩展和指令微调取得了快速发展 [vaswani2017attention, brown2020language, touvron2023llama, achiam2023gpt, bai2023qwen]。其后续训练越来越依赖于强化学习(RL),其中策略根据任务奖励或偏好信号进行优化 [christiano2017deep, stiennon2020learning, ouyang2022training]。然而,对于推理任务,RL 反馈通常被简化为一个标量结果信号,例如二元正确性。这种反馈告诉模型哪些轨迹应该被强化,但没有说明错误的推理过程应如何修复。这一限制在多步科学推理中尤其成问题。一个错误的最终答案可能源于局部的概念错误、不正确的比较或中间值的错位。结果奖励提供了梯度级别的优化压力,但它们不提供思维级别的纠正。结果,策略可能发现满足验证器的捷径,而没有学习到稳健的推理。

人类学习提供了一种不同的监督模式。教师很少只给一个分数;他们会检查学习者的尝试,识别错误的根源,并提供提示、批评或下一步建议 [wood1976role, vanlehn2011relative]。苏格拉底传统将这一过程视为引导式探究而非直接转述答案 [scott2006plato, liu2024socraticlm]。受此启发,我们提出了 **Socratic Policy Optimization (SocraticPO)**,将苏格拉底式引导引入 RL 的 rollout 阶段。学生首先独立尝试解决问题。如果尝试错误,教师根据学生的回答提供自然语言指导,学生在扩展的上下文下继续推理。必须谨慎引入指导。如果在教师干预后纠正的回答与独立解决的回答获得相同的奖励,策略可能学会一个训练时的捷径:等待帮助,利用教师提供的线索,仍然获得全部奖励。这样,辅助正确的性能会提升,而独立推理能力却没有相应提高。因此,SocraticPO 将教师指导与 **奖励衰减** 配对:在教师干预后获得的正确答案只能获得衰减后的奖励,并且随着所需指导轮次的增加,奖励递减。这鼓励学生不仅达到正确答案,而且内化纠正并在更少的帮助下提前解决。SocraticPO 只改变了 rollout 过程。学生仍然优化标准的期望奖励目标,而教师的话语作为文本上下文附加到后续的学生尝试中,而不是作为模仿目标进行优化。因此,SocraticPO 可以用现有的策略梯度后端(如 Reinforce++ [hu2025reinforce])实例化。由于教师只需生成文本级指导,该框架还可以利用更强的黑盒教师模型,而无需访问 logits、token 级似然或匹配教师和学生分布,这与概率匹配方法如 OPD [agarwal2024policy, fu2026revisiting] 不同。

我们在来自 SciKnowEval [feng2024sciknoweval] 的本科级科学推理基准上评估 SocraticPO。与强 RL 基线(包括 Reinforce++ [hu2025reinforce] 和 GRPO [shao2024deepseekmath])以及自蒸馏式训练(如 SDPO [hubotter2026reinforcement])相比,SocraticPO 取得了最佳平均性能。消融实验进一步表明,两个组件都是必要的:有针对性的指导提供了超越盲目重试的有用纠正,而奖励衰减减轻了对教师辅助纠正的依赖。我们的主要贡献包括:

- • **通用的 SocraticPO 框架**。我们提出一个交互式策略优化框架,将 RL 与教师引导的推理纠正相结合,并保持与现有策略梯度后端的兼容性。
- • **SocraticPO 的奖励衰减**。为了使教师引导的 RL 真正训练学生,而不是使奖励依赖辅助,我们引入了一种针对辅助正确性的奖励衰减机制。我们进一步刻画了其归一化优势性质,显示了非负性、单调性和饱和衰减。
- • **黑盒教师兼容性**。我们的方法仅要求教师提供文本级指导,而非分布匹配,因此兼容更强的基于 API 或其他黑盒教师模型。
- • **实证证据与分析**。我们在科学推理基准上展示了增益,并提供了关于教师指导、奖励衰减、教师侧信息以及教师-学生相似性的消融实验。

## 2 相关工作

### 2.1 大语言模型的强化学习

强化学习已成为将 LLM 与人类偏好和任务奖励对齐的核心范式 [christiano2017deep, ziegler2019fine, stiennon2020learning, ouyang2022training]。PPO [schulman2017proximal] 在 RLHF 管线中被广泛使用,反馈也可以由 AI 系统而非直接人工标注提供 [bai2022constitutional]。最近的 LLM 训练方法采用更简单或更可扩展的策略梯度变体,包括 REINFORCE 风格的更新 [williams1992simple, sutton1999policy, hu2025reinforce] 和组间相对目标如 GRPO [shao2024deepseekmath]。这些方法大多优化标量奖励信号。在推理任务中,此类奖励可以识别哪些轨迹应被强化,但不会解释推理过程中的哪部分应被纠正。过程监督工作表明,中间反馈可能比仅结果监督更具信息量 [uesato2022solving],然而如何将纠正信息注入到在线策略 RL rollout 中仍未得到充分探索。SocraticPO 通过在 rollout 采样中加入自然语言纠正,同时保留标准策略梯度目标,弥补了这一空白。

### 2.2 人类引导式教学

教育研究强调,有效的教学是互动的而非纯粹评价性的。辅导者通过检查学生当前的尝试、诊断误解并提供提示或下一步指导来搭建学习支架 [wood1976role, vanlehn2011relative]。苏格拉底传统同样将学习视为引导式探究:提问和批评帮助学习者修正答案,而不是简单复制专家解法 [scott2006plato]。最近的 NLP 工作探索了苏格拉底辅导以及与 LLM 的个性化教学对话 [liu2024socraticlm]。SocraticPO 将这一教学原则适配到 RL 训练中。教师不仅将答案标记为错误,还根据学生失败的尝试提供语言层面的纠正。同时,SocraticPO 不同于那些以优化对话质量为目标的教学系统。我们的目标是通过 RL 改进学生策略,因此教师指导与鼓励学生提前解决并减少对未来干预依赖的奖励设计相结合。

### 2.3 LLM 中的师生范式

师生学习被广泛用于 LLM 后续训练,以将能力从更强的模型转移到更小或较弱的学生模型。一种常见范式是教师生成的监督微调(SFT),其中更强的模型产生指令、答案或推理轨迹,然后被视为学生的示范数据。Self-Instruct、Alpaca、WizardLM、Orca 和逐步蒸馏都遵循这一广泛模式 [wang2023selfinstruct, taori2023alpaca, xu2023wizardlm, mukherjee2023orca, hsieh2023distilling]。最近的工作还研究了如何从教师合成与学生一致的 SFT 数据,以使示范更好地匹配学生的学习状态 [huang2026fine]。另一种范式是知识或策略蒸馏,其中学生被训练以更直接地近似教师的行为。经典蒸馏匹配教师分布或软目标 [hinton2015distilling],而在线策略蒸馏通过使用模型生成或教师塑造的轨迹来将这一思想适配到 LLM [agarwal2024policy, song2026survey, fu2026revisiting]。自蒸馏和混合蒸馏变体进一步使用模型自身的成功响应、特权轨迹或路由样本作为训练目标 [hubotter2026reinforcement, li2026srpo, ding2026hdpo, ye2026opcd]。尽管在数据源和目标上存在差异,这些方法通常要求学生模仿、近似或吸收教师般的行为。

SocraticPO 采用了一种不同的师生关系。教师不是需要被复制的示范生成器,也不是需要匹配概率的分布目标。相反,它充当一个交互式引导者:在学生尝试失败后,教师诊断错误并提供简洁的纠正性指导,而学生仍然生成自己的后续回答,并仅通过任务奖励进行优化。由于这种指导是文本级的,SocraticPO 还可以利用黑盒教师,这是该设计的一个额外优势。

## 3 预备知识

我们首先介绍单轮 LLM 训练的标准策略梯度公式,然后用它阐明 SocraticPO 改变了什么:rollout 分布,而不是期望奖励目标。

### 3.1 语言模型策略

给定输入提示 \(x\),一个具有参数 \(\theta\) 的自回归语言模型定义了关于响应序列 \(y=(y_1,\dots,y_T)\) 的策略 \(\pi_\theta(y\mid x)\)。响应概率逐个 token 分解: \(\pi_\theta(y\mid x)=\prod_{t=1}^{T}\pi_\theta(y_t\mid x, y_{<t})\)。

### 3.2 策略梯度

标准策略梯度目标(以 REINFORCE [williams1992simple] 为例)最大化期望奖励:
\[
\mathcal{J}(\theta)=\mathbb{E}_{x\sim\mathcal{D},\; y\sim\pi_\theta(\cdot\mid x)}\left[r(y)\right],
\]
其中 \(r(y)\) 是响应 \(y\) 的标量奖励。梯度估计为
\[
\nabla_\theta\mathcal{J}(\theta)=\mathbb{E}_{x,y}\left[\left(\sum_{t=1}^{T}\nabla_\theta\log\pi_\theta(y_t\mid x,y_{<t})\right)\cdot \hat{A}\right],
\]
其中 \(\hat{A}\) 是优势估计量,例如 \(r(y)-\text{baseline}\)。

### 3.3 SocraticPO 对 rollouts 的修改

关键点:SocraticPO 保持目标函数 \(\mathcal{J}(\theta)\) 不变,但改变了对 \(y\) 的采样方式。在标准 rollout 中,整个响应是从 \(\pi_\theta(\cdot\mid x)\) 中一次性采样。在 SocraticPO rollout 中,采样是交互式进行的:学生生成初始响应 \(y^{(0)}\);如果 \(r(y^{(0)})\) 不正确,教师提供一个诊断 \(g\),然后学生使用扩展上下文 \((x, y^{(0)}, g)\) 继续生成 \(y^{(1)}\);此过程可以重复。目标仍然是最大化最终响应的期望奖励,但分布是师生交互的产物,而非独立的学生采样。

## 4 方法

我们正式描述 SocraticPO 的 rollout 过程(第 4.1 节)、奖励衰减方案(第 4.2 节)以及如何将其与现有的策略梯度后端集成(第 4.3 节)。然后我们从理论上分析归一化优势(第 4.4 节)。

### 4.1 交互式 rollout

**学生初始尝试。** 给定提示 \(x\),学生策略 \(\pi_\theta\) 生成一个完整响应:
\[
y^{(0)}\sim\pi_\theta(\cdot\mid x).
\]

**教师诊断。** 如果基于 \(y^{(0)}\) 的奖励 \(r\) 不是满分(例如,对于二元正确性,\(r=1\) 表示正确),教师检查 \(y^{(0)}\) 并生成一个诊断和指导:
\[
g\sim\pi_{\text{teacher}}(\cdot\mid x, y^{(0)}).
\]
指导应该简洁(例如,1-3 句话)且具有纠正性。

**学生继续。** 学生使用扩展的上下文继续生成:
\[
y^{(1)}\sim\pi_\theta(\cdot\mid x, y^{(0)}, g).
\]
如果答案在 \(K\) 轮后仍不正确,则该过程可以继续;我们使用最大轮次 \(K_{\max}\)。完整的 rollout 产生一个序列 \(y^{(0:K)}\),其中最终响应 \(y^{(K)}\) 用于奖励计算。在训练中,我们只对最终响应的 token 进行优化。

### 4.2 奖励衰减

如果 \(r(y^{(K)})\) 在指导后正确,我们必须设计奖励值。关键思想:在指导后正确应获得正奖励,但应少于独立正确。我们定义衰减后奖励:
\[
\tilde{r}(y^{(K)}) = r(y^{(K)}) \cdot \beta^{K},
\]
其中 \(\beta\in [0,1)\) 是一个衰减因子,\(K\) 是所需的指导轮次。当 \(K=0\) 时(独立正确),衰减后奖励等于基础奖励 \(r\)。每多一轮指导,奖励都会衰减。

在训练中,我们使用衰减后奖励 \(\tilde{r}\) 来计算优势,并更新策略。这提供了一种细粒度的信用分配:独立正确的奖励高于在某个指导轮次后正确的奖励,而后者又高于从未正确的奖励(零奖励)。

### 4.3 与策略梯度后端的集成

SocraticPO 不要求改变策略梯度算法本身;它只改变 rollout 过程以适应指导。任何标准策略梯度方法(如 Reinforce++、PPO、GRPO)都可以通过替换标准数据收集流水线来使用 SocraticPO rollouts。唯一更改的地方是在数据收集期间插入指导步骤,以及奖励计算中应用衰减系数。由于教师只生成文本,无需访问学生对数几率,因此黑盒教师可以无缝集成。

### 4.4 归一化优势分析

我们在一个批次设置中分析奖励衰减的影响。假设一个 batch \(B\) 包含 \(N\) 个样本 \(i\),每个样本最终在轮次 \(K_i\) 处正确,否则正确轮次为 \(\infty\)。对于每个样本,我们定义归一化优势:
\[
\hat{a}_i^{(k)} = \frac{\tilde{r}_i - \bar{r}}{\sigma_r},
\]
其中 \(\bar{r}\) 和 \(\sigma_r\) 是 batch 内衰减后奖励的均值和标准差。奖励衰减保证以下性质:

1. **非负优势**:对于最终正确的样本,\(\tilde{r}_i > 0\)。如果 batch 中所有样本最终都正确,则 \(\bar{r} > 0\) 且某些 \(\hat{a}_i^{(k)} > 0\)。如果存在未正确的样本,则 \(\bar{r}\) 会更低,使得正确样本的优势为正值。因此,衰减奖励**不会否定辅助正确的样本的正优势**。

2. **单调递减优势**:设样本 \(i\) 在轮次 \(K\) 处正确,样本 \(j\) 在轮次 \(L\) 处正确,且 \(K < L\)。则 \(\tilde{r}_i > \tilde{r}_j\),因此 \(\hat{a}_i^{(K)} > \hat{a}_j^{(L)}\)。也就是说,较早正确的样本获得更高的优势。

3. **饱和衰减**:设 \(p_k = \frac{1}{|\mathcal{A}_k|} \sum_{i\in\mathcal{A}_k} \delta_i^{(k)}\) 是活跃样本中的纠正率。则如果 \(p_t \to 1\),我们有 \(\hat{a}_i^{(t)} \to 0\)。这意味着如果某一纠正轮次变得非区分性(几乎所有样本都能在该帮助下正确),则该轮次的正确信号不再提供强正强化。

## 5 实验

我们在科学推理任务上评估 SocraticPO。实验旨在回答两个主要问题:(1)SocraticPO 是否优于标准 RL 和师生基线?(2)它的两个关键组件(教师指导和奖励衰减)对于有效学习是否都是必要的?我们进一步包括对教师侧信息和师生相似性的诊断分析,以更好地理解交互机制何时有帮助。

### 5.1 实验设置

#### 模型。

我们使用 **Qwen3-4B-Instruct** 作为学生策略 \(\pi_\theta\)。对于教师指导,我们考虑两种设置:**Qwen3-4B-Instruct** 作为自指导教师,以及 **Qwen3.5-27B** 作为更强的教师。这使我们能够将交互机制的影响与教师能力的影响分开。

#### 数据集与指标。

按照 SDPO 评估设置,我们使用来自 SciKnowEval [feng2024sciknoweval] 推理子集的四个本科级科学推理基准:**Chemistry**、**Physics**、**Biology** 和 **Material**。我们报告每个领域的准确率以及跨领域的未加权平均值。

表 1:SciKnowEval 推理基准上的准确率。SocraticPO 变体在括号中标注教师模型。粗体表示每列最佳结果,下划线表示第二佳结果。

参见图 3:SocraticPO 与基线策略优化的训练动态。曲线说明了交互条件下的 rollout 如何在训练步骤中影响性能。

#### 基线。

我们比较 **Reinforce++** [hu2025reinforce]、**GRPO** [shao2024deepseekmath] 和 **SDPO** [hubotter2026reinforcement]。Reinforce++ 和 GRPO 代表由标量奖励驱动的 RL 方法,而 SDPO 代表自蒸馏式基线。

### 5.2 主要

相似文章

SLPO:通过代理策略扩展潜在推理

Hugging Face Daily Papers

介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。

GraphPO:面向推理模型的基于图策略优化

arXiv cs.CL

GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。