sparse-rewards

标签

Cards List
#sparse-rewards

稀疏奖励游戏中AlphaZero的局限性与辅助监督

arXiv cs.LG · 2026-07-13 缓存

本文以四子棋和Chomp为测试平台,研究了AlphaZero在稀疏奖励游戏中强对弈与完美对弈之间的差距,并提出了一种辅助损失(AZAL)以提高最优对弈中的Oracle一致性。

0 人收藏 0 人点赞
#sparse-rewards

分层优势加权:面向稀疏回合结果的VLA在线强化学习微调

Hugging Face Daily Papers · 2026-06-15 缓存

本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。

0 人收藏 0 人点赞
#sparse-rewards

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG · 2026-05-29 缓存

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。

0 人收藏 0 人点赞
#sparse-rewards

通过反思增强自蒸馏在稀有成功但反馈丰富的场景中学习

arXiv cs.LG · 2026-05-14 缓存

本文介绍了反思增强自蒸馏(RESD)框架,该框架将失败反馈转化为对LLM的纠正性监督,从而实现从稀有成功中高效学习。该框架优于标准自蒸馏基线,并且相比GRPO,使用更少的样本实现了更快的早期改进。

0 人收藏 0 人点赞
#sparse-rewards

@blc_16: 如果你想了解为什么强化学习在处理长视界智能体任务时表现不佳,这是一个很好的解释。核心问题在于……

X AI KOLs Timeline · 2026-05-10

该帖子解释了强化学习因奖励稀疏而在长视界任务中遇到的困难,并介绍了 GEPA 这一方法。GEPA 利用轨迹层级的文本反思来保留更丰富的反馈信号,以优化学习过程。

0 人收藏 0 人点赞
#sparse-rewards

机器人研究的关键要素

OpenAI Blog · 2018-02-26 缓存

OpenAI 推出了Hindsight Experience Replay (HER),这是一种强化学习技术,使机器人能够通过将实现的替代结果追溯性地作为成功目标来从失败的尝试中学习,即使在奖励信号稀疏的情况下也能进行学习。

0 人收藏 0 人点赞
#sparse-rewards

后见之明经验回放

OpenAI Blog · 2017-07-05 缓存

# 后见之明经验回放 来源:[https://openai.com/index/hindsight-experience-replay/](https://openai.com/index/hindsight-experience-replay/) ## 摘要 处理稀疏奖励是强化学习(RL)中最大的挑战之一。我们提出了一种名为后见之明经验回放的新颖技术,它允许从稀疏二元奖励中进行样本高效学习,因此避免了复杂的奖励工程设计的需要。它可以与任意组合

0 人收藏 0 人点赞
#sparse-rewards

用于分层强化学习的随机神经网络

OpenAI Blog · 2017-04-10 缓存

OpenAI 研究人员提出了一个使用随机神经网络进行分层强化学习的框架,该框架通过代理奖励引导预训练有用的技能,然后利用这些技能在稀疏奖励或长期视界的下游任务中加速学习。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈