step-level-policy-optimization

标签

Cards List
#step-level-policy-optimization

EvoCUA-1.5:面向多轮计算机使用代理的在线强化学习

arXiv cs.AI · 2026-07-14 缓存

EvoCUA-1.5 引入了一种面向多轮计算机使用代理的在线强化学习框架,在 OSWorld-Verified 上实现了 63.2% 的成功率,并通过步骤级策略优化和动态课程学习,性能超越了参数高达 35B 的可比开放权重模型。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈