bisimulation

标签

Cards List
#bisimulation

BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计

arXiv cs.CL · 2026-06-25 缓存

BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。

0 人收藏 0 人点赞
#bisimulation

利用局部动态规律实现离线分层强化学习中的可复用技能

arXiv cs.AI · 2026-05-27 缓存

本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈