标签
一篇预印本提出了 FLEET 算法,它通过将外部奖励归因到具体 token,使 Best-of-N 采样具备奖励感知能力:把隐藏状态连同奖励元数据存入向量库,并在后续迭代中使用改造后的 MCTS 重新调整 logits。在 GSM8K 和 LiveCodeBench 上使用 Llama 3.2 3B 的实验表明,该方法以远少于采样基线的迭代次数达到了相当甚至更优的性能。此外,它产出的元数据存储库可复用为其他任务的先验,或用于增强 SFT/RL。
本文介绍Spectral Feedback算法,该算法通过使用稀疏傅里叶表示迭代选择编辑位置,增强了蛋白质反折叠中离散扩散模型的测试时对齐,从而提高了奖励最大化的性能。