标签
该论文提出了一种名为 Tail-Likelihood Reinforcement Learning (TailRL) 的优化方法,该方法专注于奖励分布的上尾部分,以改善生成任务中的策略性能,并在多种应用中进行了演示。