off-policy

#off-policy

Trust Region On-Policy Distillation

Hugging Face Daily Papers ↗ · 3天前缓存

本文提出了信任区域在线策略蒸馏（Trust Region On-Policy Distillation, TrOPD），通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏，在推理和代码生成基准测试中优于现有方法。

0 人收藏 0 人点赞

#off-policy

arXiv cs.AI ↗ · 5天前缓存

本文提出用于离策略时序差分预测的行为感知辅助修正，引入了BA-TDC和BA-TDRC算法，这些算法用行为贝尔曼矩阵替代辅助协方差矩阵，以提高稳定性和收敛性。理论分析和在标准基准上的实验验证了所提方法的有效性。

0 人收藏 0 人点赞

#off-policy

arXiv cs.LG ↗ · 2026-05-18 缓存

本文介绍了一类基于f-散度的损失函数族，用于训练GFlowNet和LLM等生成模型。这些损失函数在离策略下有效，同时匹配相应f-散度的在线策略梯度。应用包括分子发现和异步LLM调优。

0 人收藏 0 人点赞

#off-policy

Hugging Face Daily Papers ↗ · 2026-05-12 缓存

本文探讨了大型语言模型（LLM）异步强化学习中的旧 logits 缺失问题，提出了精确与近似的修正方法，以提升训练稳定性和性能。

0 人收藏 0 人点赞