rl-optimization

标签

Cards List
#rl-optimization

SLCA-GRPO: 解决工具调用强化学习中的跨段信用分配错误

arXiv cs.AI ↗ · 22小时前 缓存

SLCA-GRPO 引入段锁定信用分配,通过解耦优势估计和使用层级奖励来改善工具调用代理的强化学习,从而实现更快的收敛和更高的准确性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈