experience-replay

标签

Cards List
#experience-replay

漂移与依赖:基于回放的持续学习的逐层信息论界

arXiv cs.LG · 4天前 缓存

本文提出了一个针对基于回放的持续学习的逐层信息论框架,将泛化差距分解为回放引起的表示漂移项和优化依赖项,并通过Wasserstein松弛与SGLD实例化对其进行了细化。

0 人收藏 0 人点赞
#experience-replay

基于注意力的经验回放框架:用于不可知时间序列预测模型的持续学习

arXiv cs.AI · 2026-07-24 缓存

本文提出了一种新颖的持续学习框架,用于时间序列预测,该框架利用注意力引导的经验回放,使模型能够适应新的数据分布,同时避免灾难性遗忘。该框架在标准基准和真实世界的水位数据上进行了评估。

0 人收藏 0 人点赞
#experience-replay

通过经验回放和模型融合对 IndicTrans2 在 21 种印度语言上进行会话域适应

arXiv cs.CL · 2026-06-30 缓存

本文通过经验回放和模型融合技术,将 IndicTrans2-1B 适应到 21 种印度语言的会话语域,在保持通用领域性能的同时取得了会话性能提升,但人工评估表明,基于指标的性能提升可能并未反映感知质量的改善。

0 人收藏 0 人点赞
#experience-replay

CLaaS:面向样本高效在线学习的持续学习即服务

arXiv cs.LG · 2026-06-05 缓存

CLaaS是一个系统,用于对部署中的LLM智能体进行持续学习,利用经验回放实现样本高效的在线适应。

0 人收藏 0 人点赞
#experience-replay

从模仿到交互:使用浅层强化学习掌握Schnapsen游戏

arXiv cs.AI · 2026-05-19 缓存

本文研究浅层神经网络代理是否能够通过强化学习掌握纸牌游戏Schnapsen,超越监督模仿基线,并在一项与基于强搜索的对手的对比中取得有竞争力的结果。

0 人收藏 0 人点赞
#experience-replay

面向大语言模型/视觉语言模型强化学习的鲜度感知优先经验回放

arXiv cs.CL · 2026-04-21 缓存

# 面向大语言模型/视觉语言模型强化学习的鲜度感知优先经验回放 来源:[https://arxiv.org/html/2604.16918](https://arxiv.org/html/2604.16918) Weiyu Ma1 Yongcheng Zeng2 Yan Song3 Xinyu Cui2 Jian Zhao4 Xuhui Liu1 Mohamed Elhoseiny1 1 阿卜杜拉国王科技大学 (KAUST) 2 中国科学院自动化研究所 (CASIA) 3 伦敦大学学院计算机科学系人工智能中心 4 中关村人工智能研究院 weiyu\.

0 人收藏 0 人点赞
#experience-replay

后见之明经验回放

OpenAI Blog · 2017-07-05 缓存

# 后见之明经验回放 来源:[https://openai.com/index/hindsight-experience-replay/](https://openai.com/index/hindsight-experience-replay/) ## 摘要 处理稀疏奖励是强化学习(RL)中最大的挑战之一。我们提出了一种名为后见之明经验回放的新颖技术,它允许从稀疏二元奖励中进行样本高效学习,因此避免了复杂的奖励工程设计的需要。它可以与任意组合

0 人收藏 0 人点赞
← 返回首页

提交意见反馈