verifiable-rewards

标签

Cards List
#verifiable-rewards

列表式策略优化:基于分组的 RLVR 作为 LLM 响应单纯形上的目标投影

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了列表式策略优化(LPO),这是一种用于 RLVR 的方法,通过在响应单纯形上进行散度最小化来显式处理目标投影,从而提高大语言模型(LLM)的训练稳定性和性能。

0 人收藏 0 人点赞
#verifiable-rewards

利用可验证奖励强化学习激励参数知识以优化跨文化实体翻译

arXiv cs.CL · 2026-04-21 缓存

# 利用可验证奖励强化学习激励参数知识用于跨文化实体翻译 来源:[https://arxiv.org/html/2604.16881](https://arxiv.org/html/2604.16881) Jiang Zhou1, Xiaohu Zhao2, Xinwei Wu1, Tianyu Dong1, Hao Wang2, Yangyang Liu2, Heng Liu2, Linlong Xu2, Longyue Wang2, Weihua Luo2, Deyi Xiong1† 1天津大学 TJUNLP 实验室,中国 2阿里巴巴集团,中国 [dyxiong@tju\.edu\.cn](https://arxiv.org/html/2604.16881v1/mailto:[email protected]) ###### 摘

0 人收藏 0 人点赞
#verifiable-rewards

Ecom-RLVE:面向电商对话代理的自适应可验证环境

Hugging Face Blog · 2026-04-16 缓存

Huggingface 推出 EcomRLVE-GYM,这是一个提供八个可验证环境的框架,用于在复杂电商任务上训练强化学习智能体。该工具具备自适应难度课程和算法化奖励机制,以提升购物助手的任务完成率,并已通过训练 Qwen 3 8B 模型进行了验证。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈