large-vision-language-model

标签

Cards List
#large-vision-language-model

EvoCUA-1.5:面向多轮计算机使用代理的在线强化学习

arXiv cs.AI · 2026-07-14 缓存

EvoCUA-1.5 引入了一种面向多轮计算机使用代理的在线强化学习框架,在 OSWorld-Verified 上实现了 63.2% 的成功率,并通过步骤级策略优化和动态课程学习,性能超越了参数高达 35B 的可比开放权重模型。

0 人收藏 0 人点赞
#large-vision-language-model

授之以渔而非授之以鱼:面向多模态策略优化的特权引导式蒸馏

arXiv cs.AI · 2026-06-08 缓存

本文提出PTD-PO,一种特权引导式蒸馏框架,可在多模态推理任务中为基于可验证奖励的强化学习提供密集的token级监督,且不暴露答案。该框架利用结构化提示和Top-K JS散度目标以稳定训练,在2B-8B LVLMs上持续优于现有方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈