最近发展区策略优化:教师存在于提示中,而非梯度

Hugging Face Daily Papers 论文

摘要

最近发展区策略优化(ZPPO)通过使用重新构建的提示来改进知识蒸馏,帮助学生从正确和错误的回答中学习,尤其在小模型规模下提升了性能。

知识蒸馏将教师模型的能力迁移到小型学生模型,但在小模型场景中较为脆弱:强迫学生模仿来自更大教师模型的logits,使其集中于教师最尖锐的模式,从而损害了训练语料库之外基准测试系列的泛化能力。强化学习(RL)通过基于学生自身轨迹进行训练,避免了logits模仿。然而,在每条轨迹都失败的问题上——产生零优势并被静默丢弃——将更强的教师响应注入策略梯度会打破在策略假设,并导致漂移。受维果茨基最近发展区启发,我们提出了最近发展区策略优化(ZPPO),将教师保留在提示中而非策略梯度中。对于难题,ZPPO构建两种重新构建的提示:二元候选包含问题(BCQ)将一条正确教师响应与一条错误学生响应配对,作为学生必须区分的匿名候选;负候选包含问题(NCQ)将学生的错误轨迹汇总到单一提示中,以揭示其共同的失败模式。提示回放缓冲区循环使用每个难题,直到该问题毕业(学生在其上的平均轨迹准确率达到一半)或在有限容量下被先进先出淘汰,从而在学生当前最近发展区内强化BCQ和NCQ。在Qwen3.5家族中,以四个学生规模(0.8B-9B)配合27B教师,后训练为视觉语言模型,并在31个基准测试套件(16个VLM、10个LLM、5个视频)上评估,ZPPO优于离策略/在策略蒸馏和GRPO,其中最小规模下的增益最大。
查看原文
查看缓存全文

缓存时间: 2026/06/17 03:35

论文页面 - 最近发展区策略优化:教师存在于提示中,而非梯度

来源:https://huggingface.co/papers/2606.18216 作者:

摘要

最近发展区策略优化(ZPPO)通过使用重构后的提示来改进知识蒸馏,帮助学生从正确和错误的响应中学习,从而提升性能,尤其在较小模型规模下效果显著。

知识蒸馏(https://huggingface.co/papers?q=Knowledge%20distillation)将教师模型的能力迁移至小型学生模型,但在小模型场景下较为脆弱:强制学生模仿来自较大教师模型的logits,会使其注意力集中在教师最尖锐的模式上,从而损害训练语料库之外的标准基准族上的泛化能力。强化学习(https://huggingface.co/papers?q=Reinforcement%20learning)(RL)通过基于学生自身rollout进行训练,避免了logit模仿。然而,对于每次rollout均失败(即优势为零且被静默丢弃)的问题,将更强的教师响应注入策略梯度(https://huggingface.co/papers?q=policy%20gradient)会违反在线策略假设(https://huggingface.co/papers?q=on-policy%20assumption)并引发漂移。我们提出最近发展区策略优化(ZPPO),灵感源自维果茨基的最近发展区(https://huggingface.co/papers?q=zone%20of%20proximal%20development),它让教师保留在提示中而非策略梯度(https://huggingface.co/papers?q=policy%20gradient)里。对于困难问题,ZPPO构建两种重构提示:二元候选包含问题(https://huggingface.co/papers?q=Binary%20Candidate-included%20Question)(BCQ)将一条正确教师响应与一条错误学生响应配对,作为学生必须区分的匿名候选;否定候选包含问题(https://huggingface.co/papers?q=Negative%20Candidate-included%20Question)(NCQ)将学生的错误rollout聚合到单个提示中,以呈现其共同的失败模式。提示重放缓冲区(https://huggingface.co/papers?q=prompt%20replay%20buffer)循环每个困难问题,直到其毕业(即学生对该问题的平均rollout准确率达到一半)或在有限容量下被FIFO逐出,从而放大当前最近发展区(https://huggingface.co/papers?q=zone%20of%20proximal%20development)内的BCQ和NCQ。在Qwen3.5系列上,采用四种学生规模(0.8B-9B)配合27B教师模型,作为视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)进行后训练,并在31项基准测试套件(https://huggingface.co/papers?q=benchmark%20suite)(16项VLM、10项LLM、5项视频)上评估,ZPPO优于离线/在线策略蒸馏和GRPO,且越小规模提升越大。

查看arXiv页面(https://arxiv.org/abs/2606.18216)查看PDF(https://arxiv.org/pdf/2606.18216)项目页面(https://byungkwanlee.github.io/ZPPO-page/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18216)

在你的Agent中获取本文:

hf papers read 2606.18216

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

没有模型链接本文

请在模型 README.md 中引用 arxiv.org/abs/2606.18216,以便从此页面链接。

引用本文的数据集0

没有数据集链接本文

请在数据集 README.md 中引用 arxiv.org/abs/2606.18216,以便从此页面链接。

引用本文的Space0

没有Space链接本文

请在 Space README.md 中引用 arxiv.org/abs/2606.18216,以便从此页面链接。

包含本文的合集0

没有合集包含本文

请将本文添加到合集(https://huggingface.co/new-collection)中,以便从此页面链接。

相似文章

近端策略优化

OpenAI Blog

# 近端策略优化 来源: [https://openai.com/index/openai-baselines-ppo/](https://openai.com/index/openai-baselines-ppo/) OpenAI 我们推出了一类新的强化学习算法——近端策略优化(PPO),其性能与最先进的方法相当或更优,同时实现和调优都要简单得多。由于易用性和良好的性能,PPO 已成为 OpenAI 的默认强化学习算法。[策略梯度

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。

基于梯度外推的策略优化

arXiv cs.LG

本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。