privileged-information

标签

Cards List
#privileged-information

虽有特权,却有偏见:PI条件教师如何破坏自我蒸馏

arXiv cs.AI · 2026-08-06 缓存

本文研究将带特权信息(PI)的自我蒸馏(SD)作为LLM唯一的后期训练目标,在简单任务上复现了已报告的性能提升,但表明它在困难推理任务上会失败:逐token损失下降,而验证准确率停滞或下降。作者将失败归因于PI偏置,它把教师目标拉向参考轨迹,训练出的学生更平坦、更不果断,却没有提升推理能力。

0 人收藏 0 人点赞
#privileged-information

评分标准作为开放式生成中的特权信息

arXiv cs.LG · 2026-08-05 缓存

本文介绍了评分标准作为特权信息(RuPI),通过以评分标准作为软特权信息来条件化教师模型,将同策略自蒸馏扩展到开放式生成。该方法在多个大语言模型和HealthBench等基准上优于评分标准即奖励的强化学习和参考补全蒸馏。

0 人收藏 0 人点赞
#privileged-information

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers · 2026-06-29 缓存

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

0 人收藏 0 人点赞
#privileged-information

@dbreunig: 优秀的教师会设计出学生自己就能搭建的示范。

X AI KOLs Following · 2026-05-14 缓存

Souradip Chakraborty的一条推文提出,在强化学习中使用特权信息主动采样展开(rollouts),与传统盲采样方法形成对比。该推文以一句关于优秀教师设计学生自己就能搭建的示范的引言开头。

0 人收藏 0 人点赞
#privileged-information

@SOURADIPCHAKR18:典型的RL算法和同策略蒸馏方法是盲目采样器:它们使用特权信息来评分rollouts……

X AI KOLs Following · 2026-05-14 缓存

这项工作提出使用特权信息来主动采样强化学习中的rollouts,改进了典型的盲目采样方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈