最近发展区策略优化:教师存在于提示中,而非梯度
摘要
最近发展区策略优化(ZPPO)通过使用重新构建的提示来改进知识蒸馏,帮助学生从正确和错误的回答中学习,尤其在小模型规模下提升了性能。
查看缓存全文
缓存时间: 2026/06/17 03:35
论文页面 - 最近发展区策略优化:教师存在于提示中,而非梯度
来源:https://huggingface.co/papers/2606.18216 作者:
,
,
,
,
,
,
,
,
,
摘要
最近发展区策略优化(ZPPO)通过使用重构后的提示来改进知识蒸馏,帮助学生从正确和错误的响应中学习,从而提升性能,尤其在较小模型规模下效果显著。
知识蒸馏(https://huggingface.co/papers?q=Knowledge%20distillation)将教师模型的能力迁移至小型学生模型,但在小模型场景下较为脆弱:强制学生模仿来自较大教师模型的logits,会使其注意力集中在教师最尖锐的模式上,从而损害训练语料库之外的标准基准族上的泛化能力。强化学习(https://huggingface.co/papers?q=Reinforcement%20learning)(RL)通过基于学生自身rollout进行训练,避免了logit模仿。然而,对于每次rollout均失败(即优势为零且被静默丢弃)的问题,将更强的教师响应注入策略梯度(https://huggingface.co/papers?q=policy%20gradient)会违反在线策略假设(https://huggingface.co/papers?q=on-policy%20assumption)并引发漂移。我们提出最近发展区策略优化(ZPPO),灵感源自维果茨基的最近发展区(https://huggingface.co/papers?q=zone%20of%20proximal%20development),它让教师保留在提示中而非策略梯度(https://huggingface.co/papers?q=policy%20gradient)里。对于困难问题,ZPPO构建两种重构提示:二元候选包含问题(https://huggingface.co/papers?q=Binary%20Candidate-included%20Question)(BCQ)将一条正确教师响应与一条错误学生响应配对,作为学生必须区分的匿名候选;否定候选包含问题(https://huggingface.co/papers?q=Negative%20Candidate-included%20Question)(NCQ)将学生的错误rollout聚合到单个提示中,以呈现其共同的失败模式。提示重放缓冲区(https://huggingface.co/papers?q=prompt%20replay%20buffer)循环每个困难问题,直到其毕业(即学生对该问题的平均rollout准确率达到一半)或在有限容量下被FIFO逐出,从而放大当前最近发展区(https://huggingface.co/papers?q=zone%20of%20proximal%20development)内的BCQ和NCQ。在Qwen3.5系列上,采用四种学生规模(0.8B-9B)配合27B教师模型,作为视觉语言模型(https://huggingface.co/papers?q=vision-language%20models)进行后训练,并在31项基准测试套件(https://huggingface.co/papers?q=benchmark%20suite)(16项VLM、10项LLM、5项视频)上评估,ZPPO优于离线/在线策略蒸馏和GRPO,且越小规模提升越大。
查看arXiv页面(https://arxiv.org/abs/2606.18216)查看PDF(https://arxiv.org/pdf/2606.18216)项目页面(https://byungkwanlee.github.io/ZPPO-page/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.18216)
在你的Agent中获取本文:
hf papers read 2606.18216
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
没有模型链接本文
请在模型 README.md 中引用 arxiv.org/abs/2606.18216,以便从此页面链接。
引用本文的数据集0
没有数据集链接本文
请在数据集 README.md 中引用 arxiv.org/abs/2606.18216,以便从此页面链接。
引用本文的Space0
没有Space链接本文
请在 Space README.md 中引用 arxiv.org/abs/2606.18216,以便从此页面链接。
包含本文的合集0
没有合集包含本文
请将本文添加到合集(https://huggingface.co/new-collection)中,以便从此页面链接。
相似文章
近端策略优化
# 近端策略优化 来源: [https://openai.com/index/openai-baselines-ppo/](https://openai.com/index/openai-baselines-ppo/) OpenAI 我们推出了一类新的强化学习算法——近端策略优化(PPO),其性能与最先进的方法相当或更优,同时实现和调优都要简单得多。由于易用性和良好的性能,PPO 已成为 OpenAI 的默认强化学习算法。[策略梯度
授之以渔而非授之以鱼:面向多模态策略优化的特权引导式蒸馏
本文提出PTD-PO,一种特权引导式蒸馏框架,可在多模态推理任务中为基于可验证奖励的强化学习提供密集的token级监督,且不暴露答案。该框架利用结构化提示和Top-K JS散度目标以稳定训练,在2B-8B LVLMs上持续优于现有方法。
一位学生,多位教师:通过软提示特权上下文的多任务在线策略蒸馏
PromptSD 是一种新颖的在线策略自蒸馏方法,其中教师仅通过一个可学习的软提示与学生不同,从而能够在不产生权重漂移的情况下吸收多任务知识。它在四个任务上匹配或超过完全微调,同时保留通用能力。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
基于梯度外推的策略优化
本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。