reward-maximization

标签

Cards List
#reward-maximization

为搜索加入记忆而非在奖励最大化任务中盲目采样 [R]

Reddit r/MachineLearning ↗ · 昨天

一篇预印本提出了 FLEET 算法,它通过将外部奖励归因到具体 token,使 Best-of-N 采样具备奖励感知能力:把隐藏状态连同奖励元数据存入向量库,并在后续迭代中使用改造后的 MCTS 重新调整 logits。在 GSM8K 和 LiveCodeBench 上使用 Llama 3.2 3B 的实验表明,该方法以远少于采样基线的迭代次数达到了相当甚至更优的性能。此外,它产出的元数据存储库可复用为其他任务的先验,或用于增强 SFT/RL。

0 人收藏 0 人点赞
#reward-maximization

用于蛋白质扩散模型测试时对齐的Spectral Feedback

arXiv cs.AI ↗ · 6天前 缓存

本文介绍Spectral Feedback算法,该算法通过使用稀疏傅里叶表示迭代选择编辑位置,增强了蛋白质反折叠中离散扩散模型的测试时对齐,从而提高了奖励最大化的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈