标签
本文介绍了Private Best-of-N (PrivBoN)和Private Inference-Time Pessimism (PrivITP)方法,这些方法在推理时对齐中向奖励分数添加校准噪声,以实现差分隐私并减轻奖励哈希,且额外对齐成本最小。
本文探讨了在元强化学习中使用拟蒙特卡洛(QMC)方法进行权重初始化,与正交初始化相比,在类似的控制任务中显示出改进的收敛性。