DASH-OPD:用于同策略蒸馏的具有滞回的差异感知切换
摘要
本文提出DASH-OPD,一种用于多轮LLM智能体训练中同策略蒸馏的差异感知切换方法,它根据漂移和恢复证据自适应地在教师和学生执行器之间切换,以提高效率和性能。
arXiv:2607.29078v1 公告类型:新
摘要:同策略蒸馏(OPD)在student模型自己的rollout上训练student模型,以减少暴露偏差。然而,在多轮智能体场景中,student早期的错误可能导致轨迹偏离教师熟悉的领域。现有的课程学习方法根据训练进度来调节教师支持的使用量,但无法确定何时需要支持。鉴于此,我们提出DASH-OPD —— 用于OPD的基于滞回的差异感知切换(Discrepancy-Aware Switching with Hysteresis for OPD),一种新的智能体OPD方法,能够自适应且双向地切换执行器。在每一轮,DASH-OPD计算两个执行器在动作token上的平均对数概率比,作为它们的差异。学生轮次中学生到教师的比率形成漂移信号,而教师轮次中教师到学生的比率形成恢复信号。这些信号经过归一化,并在多轮中累积为漂移和恢复证据。当证据超过相应的切换阈值时,DASH-OPD切换执行器。这种多轮累积使切换具有滞回性,防止由瞬时波动引起的高频切换。在ALFWorld上,DASH-OPD优于所有基线,并展现出卓越的训练和部署效率。本文为进行中工作。代码、训练日志和模型检查点将稍后发布。
查看缓存全文
缓存时间: 2026/08/03 07:36
# DASH-OPD:基于滞回与差异感知切换的在线策略蒸馏
来源:https://arxiv.org/html/2607.29078
Yuchen Xia1,2,Qianguo Sun2,Chao Song2,Junlong Wu3,Yiyan Qi2,Yunjian Xu1††footnotemark: 1
1香港中文大学
2IDEA研究院
3Emdoor研究院
1\{ycxia,yjxu\}@mae\.cuhk\.edu\.hk
2\{xiayuchen,sunqianguo,songchao,qiyiyan\}@idea\.edu\.cn
3junlong\.wu@emdoor\.com
###### 摘要
在线策略蒸馏(OPD)在学生模型自身的轨迹上训练学生模型,以减少曝光偏差。然而,在多轮智能体场景中,学生早期的错误可能导致轨迹偏离教师模型所熟悉的领域。现有的课程学习方法根据训练进度来调节教师支持的使用量,但无法判断何时需要教师支持。鉴于此,我们提出DASH-OPD——一种用于OPD的基于滞回与差异感知的切换方法,这是一种新的智能体OPD方法,能够自适应且双向地切换执行器。在每一轮,DASH-OPD计算两个执行器在动作令牌上的平均对数概率比,作为它们的差异。学生轮次中的学生到教师比率形成漂移信号,而教师轮次中的教师到学生比率形成恢复信号。这些信号经过归一化处理,并在多轮中累积为漂移证据和恢复证据。当证据超过相应的切换阈值时,DASH-OPD切换执行器。这种多轮累积使得切换具有滞回特性,从而防止由瞬时波动引起的高频切换。在ALFWorld上,DASH-OPD优于所有基线,并展现出卓越的训练和部署效率。本文为工作进展中版本。代码、训练日志和模型检查点将在后续发布。
## 1 引言
参见图注1:现有的轨迹课程使用固定或随机的教师干预调度。
大语言模型(LLM)智能体通过交错执行推理、动作和环境反馈来解决长时程任务[yao2023react, wang2022scienceworld, yao2022webshop],但它们最强的能力往往存在于部署成本过高的模型中[chen2024frugalgpt]。知识蒸馏[hinton2015distilling, kim2016sequence, gu2024minillm]可以将这些能力迁移到更小的学生模型上。在线策略蒸馏(OPD)[agarwal2024onpolicy]进一步在学生生成的输出上进行训练,以减少训练与推理之间的不匹配(即曝光偏差)。然而,在多轮交互中,OPD的优势变得脆弱:学生早期的错误可能将轨迹推离教师模型所熟悉的领域,从而降低教师指导的质量[wang2026tcod, li2026guided]。教师生成的轮次可以修复即将崩溃的轨迹,但过度干预会减少学生状态覆盖,并重新引入曝光偏差。
最近的智能体OPD方法试图通过轨迹调度来平衡教师和学生的控制。如图1(https://arxiv.org/html/2607.29078#S1.F1)所示,TCOD[wang2026tcod]逐步扩展轨迹中学生控制的片段,而Guided-OPD[li2026guided]随机采样每一轮的执行器,并随着训练进度逐渐降低教师干预概率。这些方法调节了使用多少教师支持,但没有调节何时需要教师支持。对教师支持的需求在同一训练步骤的不同轨迹之间可能不同,在同一条轨迹的不同片段之间也可能不同[hoque2022thrifty, cai2025adaptive]。
参见图注2:DASH-OPD将教师与学生之间的差异累积为漂移证据和恢复证据,从而实现这两个模型之间的自适应双向切换。
为解决这一问题,我们提出DASH-OPD:用于OPD的基于滞回与差异感知的切换方法。DASH-OPD的整体流程如图2(https://arxiv.org/html/2607.29078#S1.F2)所示。当前执行器生成一轮后,另一个模型对该响应中的动作进行评分,得到两个执行器在该轮上的平均对数概率比。该比率量化了教师与学生之间的差异。在学生轮次中,学生到教师比率形成漂移信号,衡量学生偏离教师熟悉领域的程度。在教师轮次中,教师到学生比率形成恢复信号,衡量学生重新进入教师熟悉领域的程度。这两类信号经过归一化处理,并在多轮中分别累积为两种证据。漂移信号形成漂移证据,累积对教师支持的“支持债务”;恢复信号形成恢复证据,累积对学生回归的“返回信用”。DASH-OPD通过将漂移证据和恢复证据与各自的切换阈值进行比较,在教师和学生之间切换。
DASH-OPD的切换机制具有滞回特性,因为它作用于多轮累积的证据,而不是瞬时信号。只有当持续的漂移信号将漂移证据推过支持阈值时,才提供教师支持。同样,只有当持续的恢复信号将恢复证据推过返回阈值时,控制权才归还给学生。因此,瞬时波动不足以改变执行器,从而防止高频切换。据我们所知,DASH-OPD是第一个能够自适应且双向切换执行器的智能体OPD方法。这种能力将教师支持引导到最需要的地方,并带来性能的提升。在ALFWorld[shridhar2021alfworld]上,DASH-OPD在所有评估划分和学生规模上均取得了最高成功率,同时在六种设置中的五种所需交互轮次最少(其余一种排名第二)。DASH-OPD还展现出显著更高的训练和部署效率:相对于Guided-OPD,教师生成轮次减少了35.4%,执行器切换减少了77.1%,并且在成功率和生成成本方面Pareto支配所有OPD基线。
## 2 相关工作
#### 智能体OPD。
轮级轨迹调度已成为智能体OPD的研究前沿。TCOD[wang2026tcod]控制学生随着训练进展可以在轨迹中推进多远,它根据固定的时间课程逐步扩展学生控制的片段。Guided-OPD[li2026guided]则调度每一轮由谁生成,它在轮边界采样教师或学生,使用逐渐降低的教师干预概率。这两种方法都根据预定义的课程[bengio2009curriculum]来调节教师支持,而不是自适应地切换执行器。TurnOPD[zhou2026turnopd]使用基于探针的轮统计信息来调整轨迹深度,在后继轮次不太可能提供有用监督时停止。这提高了轨迹调度的灵活性,但在轨迹过程中没有利用教师支持的好处。
#### 通用OPD。
令牌级轨迹调度在通用OPD中也有研究[koo2025switch]。AdaSwitch[peng2026adaswitch]用上下文相关的阈值替代固定切换阈值,但只允许一次从学生到教师的切换,之后由教师完成响应。其他工作调度学生轨迹的持续时间。POPD和TOPD[zhang2026fullrollouts]都通过预定的水平来控制学生轨迹长度:POPD随训练进度逐步扩展水平,而TOPD保持水平固定。ESR[zhou2026earlystopping]类似地只蒸馏前固定数量的响应令牌。
## 3 预备知识
### 3.1 多轮智能体
与静态生成不同,多轮智能体在动态环境中运行,每个响应都会影响下一个状态[liu2024agentbench]。在第t轮,环境发出观测o_t,智能体以历史h_t=(x,o_1,y_1,...,o_t)为条件,其中x是任务提示,y_t是一个响应,其解析出的动作产生o_{t+1}。响应y_t=(y_{t,1},...,y_{t,L_t})由策略π自回归生成:
π(y_t | h_t) = ∏_{i=1}^{L_t} π(y_{t,i} | h_t, y_{t,<i}),(1)
其中L_t是响应长度。策略π_T表示教师,π_θ表示学生。
### 3.2 在线策略蒸馏
Vanilla OPD[agarwal2024onpolicy]通过最小化前向KL散度来训练学生策略π_θ,使其模仿教师策略π_T:
L_forward = E_{y ∼ π_T(·|h)} [ -log π_θ(y|h) ],(2)
其中h是上下文。然而,这种前向KL训练暴露于教师轨迹,可能产生曝光偏差:在推理时,学生的自身错误可能累积,而模型在训练中从未见过这些错误状态。Guided-OPD[li2026guided]使用反向KL蒸馏来训练学生自身生成的轨迹:
L_reverse = E_{y ∼ π_θ(·|h)} [ (log π_θ(y|h) - log π_T(y|h)) ],(3)
这鼓励学生模式落在教师的高概率区域内。
### 3.3 智能体OPD中的轨迹调度
智能体OPD方法在轮级别上协调教师和学生的生成。然而,现有的调度机制不是自适应的,也不能双向切换:TCOD[wang2026tcod]使用固定的时间课程,而Guided-OPD[li2026guided]使用固定的概率衰减。两者都根据训练进度而不根据当前轨迹的状态来调节教师支持。
## 4 方法
### 4.1 问题表述
在多轮OPD中,在第t次交互轮,执行器m_t ∈ {S, T}确定哪个策略生成y_t,其中m_t = S表示学生,m_t = T表示教师。我们的目标是设计一个控制器,它能根据当前轨迹的状态,在每一轮选择执行器m_{t+1},从而自适应地决定教师支持的时机和位置,同时保持双向切换的能力。
### 4.2 方向性差异信号
在执行器m_t生成y_t后,另一个模型对y_t中解析出的动作a_t进行评分。设A_{t,i}为动作令牌掩码,使a_t = {y_{t,i} | A_{t,i} = 1}。我们计算学生和教师之间的方向性对数概率比。对于学生轮次(m_t = S),学生到教师比率为:
d_t^S = (1/|A_t|) Σ_i A_{t,i} (log π_θ̄(y_{t,i} | h_t, y_{t,<i}) - log π_T(y_{t,i} | h_t, y_{t,<i})),(4)
其中π_θ̄是用于评分的学生快照(详见4.4节)。对于教师轮次(m_t = T),教师到学生比率为:
d_t^T = (1/|A_t|) Σ_i A_{t,i} (log π_T(y_{t,i} | h_t, y_{t,<i}) - log π_θ̄(y_{t,i} | h_t, y_{t,<i})),(5)
其中|A_t| = Σ_i A_{t,i}是动作中的令牌数量。我们将这些有符号比率归一化:
d̄_t^{m_t} = (d_t^{m_t} - v_min) / (v_max - v_min),(6)
其中v_min和v_max是归一化边界。我们使用v_min = 10^{-6}且不设上限,因此比值被压缩到[0, ∞)区间,同时保持对比度。
### 4.3 作为证据的累积
单个轮次的信号可能是噪声。我们维护一个受控的随机游走,将归一化信号累积为证据:
- 在学生轮次,漂移证据D更新为:D ← D + ρ_d d̄_t^S,(7)
- 在教师轮次,恢复证据R更新为:R ← R + ρ_r d̄_t^T,(8)
其中ρ_d和ρ_r是学习率。我们根据训练进度缩放这些学习率:
ρ_d = ρ · (H_max / T_max),ρ_r = ρ,(9)
其中ρ是基准学习率,H_max是最大教师预算(4.4节),T_max是最大轮数。这种缩放使得漂移信号以与恢复信号大致相当的速度累积,因为教师轮次的数量受到H_max的限制,而学生轮次的数量不受限制。为了在长期轨迹中保持灵敏度,我们还对累积的证据施加目标半衰期(在4.4节讨论)。我们不在信号上施加符号边界;负信号自然减少证据。
### 4.4 切换规则
#### 支持条件。
当漂移证据超过阈值τ_on时,进入教师支持,但仅在总教师轮次数H_t小于预算H_max且剩余轮次数足够时如此。完整条件为:
support_t = (D_t > τ_on ∨ g_t) ∧ (H_max - H_t ≥ l_min),(10)
其中H_t是已生成的教师轮次总数,g_t是检测停滞的标志。当动作或观测在K个连续学生轮次中重复时,该标志被激活。如果support_t成立,DASH-OPD设置m_{t+1} = T,并将漂移证据重置为零。
#### 返回条件。
在一次教师轮次之后,将控制权归还给学生的条件是:
return_t = (R_t > τ_off ∨ H_t ≥ H_max) ∧ l_t ≥ l_min,(11)
其中l_t是当前教师片段的长度。如果return_t成立,DASH-OPD设置m_{t+1} = S,并将恢复证据重置为零。
#### 轨迹初始化。
对于每条轨迹,第一轮的执行器随机选择。选择教师的概率随训练进展线性下降:
p_T(s) = 1 - s/S_max,(12)
其中s是当前训练步,S_max是最大训练步数。这种热启动在训练早期提供更多教师生成的初始状态,并随着学生进步而线性衰减。它只影响第一轮,之后所有切换都遵循公式10(https://arxiv.org/html/2607.29078#S4.E10)和11(https://arxiv.org/html/2607.29078#S4.E11)。
### 4.5 角色感知蒸馏
遵循Guided-OPD[li2026guided],我们在学生轮次使用反向KL蒸馏,在教师轮次使用前向KL蒸馏。设L_{t,i}^S和L_{t,i}^T表示相应的逐令牌损失,I_t^S = I[m_t = S],I_t^T = I[m_t = T]。总体目标为:
L_overall = Σ_{t,i} M_{t,i} (I_t^S L_{t,i}^S + λ_T I_t^T L_{t,i}^T) / max(Σ_{t,i} M_{t,i}, 1),(13)
其中λ_T控制教师生成令牌的贡献,M_{t,i}表示第t轮响应中第i个令牌的掩码。M_{t,i}覆盖所有有效响应令牌,与仅动作的差异掩码A_{t,i}不同。每一轮选择的执行器也决定了蒸馏方向。
### 4.6 算法与成本
算法1:DASH-OPD用于一条训练轨迹
1:学生π_θ及其快照π_θ̄、教师π_T、环境E、训练步s和控制器超参数
2:初始化H_max ← ⌊qT_max⌋,D, R, H, l ← 0,以及R^S, R^T ← ∅
3:若H_max ≥ l_min,则通过公式12(https://arxiv.org/html/2607.29078#S4.E12)采样m_1;否则设置m_1 ← S
4:对于 t = 1, ..., T_max 执行
5:通过公式4(https://arxiv.org/html/2607.29078#S4.E4)生成y_t,并获得其在π_θ̄和π_T下的对数概率
6:通过公式5(https://arxiv.org/html/2607.29078#S4.E5)、6(https://arxiv.org/html/2607.29078#S4.E6)和7(https://arxiv.org/html/2607.29078#S4.E7)计算d_t^{m_t}和d̄_t^{m_t};更新R^{m_t}
7:从y_t解析动作a_t;记录(h_t, y_t, m_t)和令牌对数概率
8:如果 m_t = S 则
9:根据当前学生片段内的重复更新g_t
10:通过公式8(https://arxiv.org/html/2607.29078#S4.E8)更新D,并通过公式10(https://arxiv.org/html/2607.29078#S4.E10)评估support_t
11:若support_t则(m_{t+1}, D) ← (T, 0);否则m_{t+1} ← S
12:否则
13:H ← H + 1;l ← l + 1;通过公式9(https://arxiv.org/html/2607.29078#S4.E9)更新R
14:通过公式11(https://arxiv.org/html/2607.29078#S4.E11)评估return_t
15:若return_t则(m_{t+1}, R, l) ← (S, 0, 0);否则m_{t+1} ← T
16:结束条件
17:用a_t推进E;若达到终止则跳出
18:结束循环
19:通过公式13(https://arxiv.org/html/2607.29078#S4.E13)更新π_θ
算法1(https://arxiv.org/html/2607.29078#alg1)展示了DASH-OPD的伪代码。对于长度为L_t的响应,计算方向性差异的成本为O(L_t)。所有后续控制器操作每轮耗时O(1),并且轨迹局部内存占用为O(1)。
## 5 实验
### 5.1 实验设置
#### 环境与指标。
我们在ALFWorld[shridhar2021alfworld]上评估DASH-OPD和基线。ALFWorld是一个基于文本的家庭环境,要求智能体通过多轮交互完成组合式任务。遵循Guided-OPD[li2026guided],我们使用ALFWorld中全部140个IID任务和全部134个OOD任务。每个任务尝试一次,最大交互轮数为30。我们报告成功率(SR,越高越好)和平均交互轮数(Round,越低越好)。
#### 模型与优化。
我们研究Qwen3-1.7B和Qwen3-4B学生模型,使用冻结的Qwen3-30B-A3B教师模型[yang2025qwen3]。在每个学生规模下,每个蒸馏策略训练250个优化器步骤,轨迹批大小为16,训练批大小为64,学习率为10^{-6},KL系数为1.0。训练轨迹使用温度1.0和最大响应长度512个令牌。所有实验在8张NVIDIA A100 GPU(每张80GB内存)上进行。
#### DASH-OPD配置。
我们使用ρ=1,v_min=10^{-6},不设信号边界,也不设松弛(κ_S=κ_T=0)。切换阈值为(τ_on, τ_off) = (3, 1),最小教师片段长度为l_min=2,停滞阈值为K=3。教师预算覆盖完整的30轮水平(q=1)。两个学生模型规模使用相同的控制器配置。
#### 评估协议。
所有蒸馏策略在评估时仅使用学生模型,不访问教师。我们使用8个并行工作进程,温度0.4,top-p=1,不进行top-k或min-p截断,响应限制为4,096个令牌,使用两轮观测-动作历史,种子42。所有方法使用相同的评估配置。
#### 基线与报告约定。
我们与零样本学生、vanilla OPD[agarwal2024onpolicy]、TCOD[wang2026tcod]和Guided-OPD[li2026guided]进行比较。零样本教师作为参考纳入。Vanilla OPD完全由学生生成训练轨迹。TCOD逐步扩展学相似文章
DOPD: 双在线策略蒸馏
DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。
基于前缀重放的多轮在线策略蒸馏
本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。
TurnOPD: 使在线策略蒸馏对回合感知以实现高效长程智能体训练
TurnOPD 引入了回合级别的预算机制用于长程智能体的在线策略蒸馏,通过自适应 rollout 深度和渐进式回合归一化损失预算解决了传统 OPD 的低效问题,在相同训练预算下实现了更高的准确性。
AsyncOPD:在策略蒸馏可以有多陈旧?
本文提出 AsyncOPD,一种完全异步的在策略蒸馏流程,用于大语言模型,系统研究了陈旧策略数据的影响,并提出了估计器设计,使训练吞吐量提升 1.6-3.8 倍,同时保持相当的准确率。
DiffusionOPD:扩散模型中在线策略蒸馏的统一视角
DiffusionOPD提出了一种扩散模型的多任务训练范式,利用在线策略蒸馏将任务特定的教师模型高效地整合到统一的学生模型中,在所有评估基准上取得了最先进的结果。