PBSD:用于长时域信用分配的特权贝叶斯自蒸馏
摘要
PBSD提出了一种贝叶斯自蒸馏方法,将稀疏的最终奖励转化为经过校准的回合级信用信号,用于长时域智能体任务,从而改进策略学习与泛化能力。
查看缓存全文
缓存时间: 2026/06/09 08:41
论文页面 - PBSD:用于长时域信用分配的特权贝叶斯自蒸馏
来源:https://huggingface.co/papers/2606.09348
摘要
特权贝叶斯自蒸馏(Privileged Bayesian Self-Distillation)通过贝叶斯证据评分和自回归分解,将稀疏的结果奖励转化为校准后的回合级别信号,从而在长时域任务中实现细粒度的信用分配。
长时域代理任务给基于结果的强化学习(https://huggingface.co/papers?q=reinforcement%20learning)带来了根本性的信用分配(https://huggingface.co/papers?q=credit%20assignment)挑战:轨迹级别的奖励(https://huggingface.co/papers?q=trajectory-level%20rewards)可以验证最终的正确性,但难以提供关于哪些中间推理步骤或工具交互对结果有贡献的指导。这种困难在多轮搜索代理中尤为突出,因为成功的轨迹可能包含误导性动作,而失败的轨迹可能包含有价值的证据收集步骤。我们提出 PBSD(Privileged Bayesian Self-Distillation,特权贝叶斯自蒸馏(https://huggingface.co/papers?q=Self-Distillation)),一种针对稀疏最终奖励下的细粒度信用分配(https://huggingface.co/papers?q=credit%20assignment)的贝叶斯校准自蒸馏(https://huggingface.co/papers?q=self-distillation)方法。PBSD 通过验证答案的后验与先验概率比来衡量轨迹质量,并应用贝叶斯法则将这个难以估计的答案侧比率转换为一个易于处理的似然比,该似然比介于标准学生模型与特权条件于答案的教师模型之间。对该贝叶斯证据分数的自回归分解(https://huggingface.co/papers?q=Autoregressive%20decomposition)生成回合级别信号(https://huggingface.co/papers?q=turn-level%20signals),能够识别每个中间回合是支持还是削弱已验证的结果。因此,PBSD 提供了一种原则性且优雅的重新加权方案,将稀疏的结果监督转化为贝叶斯校准的回合级别信用信号,同时与标准策略优化(https://huggingface.co/papers?q=policy%20optimization)完全兼容。实验表明,PBSD 在领域内和领域外设置中均能持续提升性能,并有效地将知识从短上下文训练迁移到长上下文推理,表明其细粒度的信用分配(https://huggingface.co/papers?q=credit%20assignment)机制有助于更有效的策略学习,并带来更好的泛化能力。
查看 arXiv 页面(https://arxiv.org/abs/2606.09348)查看 PDF(https://arxiv.org/pdf/2606.09348)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09348)
在您的代理中获取此论文:
hf papers read 2606.09348
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.09348 以从该页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.09348 以从该页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.09348 以从该页面链接。
包含此论文的合集0
没有合集包含此论文
将此论文添加到合集(https://huggingface.co/new-collection)中以从该页面链接。
相似文章
AgentOPSD:智能体强化学习中的递归自蒸馏
AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。
DAPD:双锚定策略蒸馏
本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。
β-OPSD:以策略优化推导,以自蒸馏训练
本文介绍了β-OPSD,它是同策略自蒸馏(OPSD)的一种泛化形式,将其构建为一个具有可控KL惩罚的策略优化家族。该方法利用蒸馏来近似昂贵的策略优化,在数学基准上提升了稳定性和推理性能。
自蒸馏策略梯度
SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。
通过反事实推理路径减少信用分配方差
提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。