vector-reward

标签

Cards List
#vector-reward

向量策略优化:面向多样性的训练提升测试时搜索性能

Reddit r/LocalLLaMA · 2026-05-22 缓存

本文介绍了一种名为向量策略优化(Vector Policy Optimization, VPO)的强化学习算法,该算法通过优化多个奖励维度来训练大语言模型生成多样化的解决方案,与标量强化学习基线相比,显著提升了测试时搜索性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈