sampling-methods

标签

Cards List
#sampling-methods

无悔的隐私:差分隐私推理时对齐

arXiv cs.LG · 2026-08-28 缓存

本文介绍了Private Best-of-N (PrivBoN)和Private Inference-Time Pessimism (PrivITP)方法,这些方法在推理时对齐中向奖励分数添加校准噪声,以实现差分隐私并减轻奖励哈希,且额外对齐成本最小。

0 人收藏 0 人点赞
#sampling-methods

元强化学习的拟蒙特卡洛初始化

arXiv cs.LG · 2026-07-27 缓存

本文探讨了在元强化学习中使用拟蒙特卡洛(QMC)方法进行权重初始化,与正交初始化相比,在类似的控制任务中显示出改进的收敛性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈