efficient-exploration

标签

Cards List
#efficient-exploration

过程奖励引导的树状展开实现高效多轮强化学习

arXiv cs.CL · 昨天 缓存

提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈