task-transformation

标签

Cards List
#task-transformation

从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励

Hugging Face Daily Papers · 2026-07-26 缓存

本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈