group-policy-optimization

标签

Cards List
#group-policy-optimization

面向长周期代理任务的进度条件组策略优化

arXiv cs.LG · 2026-07-28 缓存

提出进度条件组策略优化(ProGPO),通过在组内所有样本均失败时使用首次访问的观察覆盖率,克服长周期代理任务中的信用分配问题,在ALFWorld和WebShop上提升了性能。

0 人收藏 0 人点赞
#group-policy-optimization

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI · 2026-07-07 缓存

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈