exploration-exploitation

标签

Cards List
#exploration-exploitation

WarpSAC: 通过重新思考探索与利用,迈向可扩展的非策略强化学习的顶峰

Hugging Face Daily Papers · 2026-08-25 缓存

提出 WarpSAC,一种感知环境的非策略强化学习算法,该算法根据数据可用性调整稳定器,在 CPU 规模和 GPU 并行环境中显著提高了性能,优于 FlashSAC。

0 人收藏 0 人点赞
#exploration-exploitation

重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合

arXiv cs.AI · 2026-07-31 缓存

本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。

0 人收藏 0 人点赞
#exploration-exploitation

组熵控制策略优化

Hugging Face Daily Papers · 2026-07-18 缓存

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。

0 人收藏 0 人点赞
#exploration-exploitation

LatentGym: 面向可控隐变量结构的跨任务经验学习测试平台

arXiv cs.LG · 2026-06-16 缓存

介绍了LatentGym,这是一个可控测试平台,用于研究LLM代理的跨任务经验学习,能够测量探索与利用,并揭示前沿模型为何无法在相关任务间适应。

0 人收藏 0 人点赞
#exploration-exploitation

重新审视熵正则化:自适应系数释放其在LLM强化学习中的潜力

arXiv cs.CL · 2026-04-20 缓存

本文提出自适应熵正则化(AER)框架,通过难度感知的系数分配和初始锚定目标熵来动态平衡LLM强化学习中的探索与利用,解决策略熵坍缩问题。在数学推理基准上的实验验证了该方法在准确性和探索能力上的一致性改进。

0 人收藏 0 人点赞
#exploration-exploitation

DiPO:基于解耦困惑度的策略优化,实现细粒度探索-利用权衡

Hugging Face Daily Papers · 2026-04-15 缓存

# 论文页面 - DiPO:基于解耦困惑度的策略优化,实现细粒度探索-利用权衡 来源:[https://huggingface.co/papers/2604.13902](https://huggingface.co/papers/2604.13902) 作者:,,,,,,,,,, ## 摘要 一种面向大语言模型的新型强化学习方法,通过基于困惑度的样本划分与双向奖励分配机制,解决探索-利用权衡问题。[强化学习](https:

0 人收藏 0 人点赞
← 返回首页

提交意见反馈