token-level-supervision

标签

Cards List
#token-level-supervision

DOPD: 双在线策略蒸馏

Hugging Face Daily Papers · 2026-06-29 缓存

DOPD提出了一种双在线策略蒸馏范式,该范式基于优势差距和概率,在特权教师和学生策略之间动态路由令牌级监督,解决了特权幻觉问题,并提升了LLM和VLM中的能力迁移。

0 人收藏 0 人点赞
#token-level-supervision

@VukRosic99: 当小模型从大模型学习时,一半的教训被浪费了 设置:一个小的“学生”模型写出答案…

X AI KOLs Timeline · 2026-06-28 缓存

该论文识别了语言模型在策略蒸馏中的位置偏差,即学生模型生成的答案中后面的token接收到的监督质量下降。所提出的重要性加权在策略蒸馏(IW-OPD)根据累积漂移对修正进行加权,提高了学习速度和最终性能。

0 人收藏 0 人点赞
#token-level-supervision

Trust Region On-Policy Distillation

Hugging Face Daily Papers · 2026-05-31 缓存

本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。

0 人收藏 0 人点赞
#token-level-supervision

教师令牌何时可靠?基于位置加权的在线策略自蒸馏方法在推理中的应用

arXiv cs.LG · 2026-05-22 缓存

本文发现,推理蒸馏中教师令牌的可靠性具有轨迹结构特性,并提出了基于位置加权的在线策略自蒸馏方法(PW-OPSD),该方法通过应用递增的位置权重,在不增加教师计算量的情况下提升了性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈