trust-region

标签

Cards List
#trust-region

信任区域策略蒸馏

Hugging Face Daily Papers · 2026-07-06 缓存

信任区域策略蒸馏(TOP-D)通过动态构建近端教师来稳定在线策略蒸馏,提供理论收敛保证,并在数学推理任务中实现零额外开销的实证收益。

0 人收藏 0 人点赞
#trust-region

KLip-PPO: 从逐样本KL角度解读PPO-Clip

arXiv cs.LG · 2026-06-24 缓存

本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。

0 人收藏 0 人点赞
#trust-region

TRIDENT:打破混合安全-物理耦合的可证明安全多智能体强化学习框架

arXiv cs.LG · 2026-06-18 缓存

TRIDENT是一种新颖的多智能体强化学习框架,打破了混合离散-连续动作、硬安全约束和物理支配动力学之间的耦合,实现了可证明安全的协调,保证了收敛到约束纳什均衡,并显著减少了训练期间的违规行为。

0 人收藏 0 人点赞
#trust-region

超越LLM强化学习中的统一令牌级信任区域

Hugging Face Daily Papers · 2026-06-09 缓存

本文介绍了CPPO,这是一种通过使用位置加权阈值和累积前缀预算来改进基于可验证奖励的LLM强化学习方法,旨在解决统一令牌级信任区域的局限性。

0 人收藏 0 人点赞
#trust-region

重新思考LLM强化学习中的散度正则化

Hugging Face Daily Papers · 2026-06-08 缓存

本文介绍了DRPO,它用平滑的优势加权二次正则化器替代了DPPO中的硬掩码,通过提供信任区域边界之外的连续梯度校正,提高了LLM强化学习的稳定性和效率。

0 人收藏 0 人点赞
#trust-region

Trust Region On-Policy Distillation

Hugging Face Daily Papers · 2026-05-31 缓存

本文提出了信任区域在线策略蒸馏(Trust Region On-Policy Distillation, TrOPD),通过使用信任区域、异常值估计和离策略引导来稳定大型语言模型的在线策略蒸馏,在推理和代码生成基准测试中优于现有方法。

0 人收藏 0 人点赞
#trust-region

面向在线策略蒸馏的信任区域行为融合

Hugging Face Daily Papers · 2026-05-29 缓存

信任区域行为融合(TRB)通过在线策略蒸馏的预热阶段,在KL信任区域内用教师行为替换学生早期的劣质轨迹,从而在数学推理任务上取得更强结果。

0 人收藏 0 人点赞
#trust-region

信任区域Q伴随匹配

Hugging Face Daily Papers · 2026-05-26 缓存

信任区域Q伴随匹配(TRQAM)通过投影对偶下降自适应控制路径空间KL散度,解决了离线策略强化学习中的不稳定性问题,从而实现对预训练流策略的稳定微调。该方法在50个OGBench任务上持续优于先前方法,在离线强化学习中达到68%的成功率,而最强基线仅为46%。

0 人收藏 0 人点赞
#trust-region

TeamTR:多智能体LLM协调的信任域微调

arXiv cs.LG · 2026-05-18 缓存

本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。

0 人收藏 0 人点赞
#trust-region

信任域逆强化学习:利用局部策略更新进行显式对偶上升

arXiv cs.LG · 2026-05-13 缓存

本文介绍了信任域逆强化学习(TRIRL),这是一种结合了单调对偶改进与高效局部策略更新的方法,其性能优于最先进的模仿学习方法。该方法通过使用信任域约束,解决了逆强化学习中稳定性与计算成本之间的权衡问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈