Sleep 用于持续学习(24分钟阅读)
摘要
Google 研究人员提出了一种名为 'Sleep' 的持续学习范式,通过蒸馏和回放将短期上下文知识整合到长期模型参数中。'Dreaming' 阶段则利用强化学习生成用于自我改进的合成课程。
Google 研究人员提出了一种新的 “Sleep” 范式,帮助模型通过蒸馏和回放将短期上下文知识整合到长期参数中。该方法还利用了结合强化学习的 “Dreaming” 阶段,生成用于自我改进的合成课程。
相似文章
语言模型需要睡眠:学习自我修改与巩固记忆
本文提出了一种针对大型语言模型的“睡眠”范式,该范式通过记忆巩固和梦境阶段实现持续学习,使模型能够将短期知识提炼为长期参数,并在无需人工监督的情况下自我改进。
2026年年中的持续学习:各方攻克路线图——记忆层、“梦境”智能体和在网络内部学习的后Transformer模型
2026年年中持续学习现状与未来展望的概述,涵盖记忆方法(包括外部记忆、状态内记忆和权重更新),并分析了TTT、Titans和Dragon Hatchling等各类模型。
语言模型需要睡眠
本文提出了一种针对Transformer模型的类睡眠巩固机制,该机制利用快速权重和递归传递来改进长上下文处理,同时保持推理速度。
语言模型需要睡眠
本文提出了一种类似睡眠的巩固机制,适用于基于Transformer的大语言模型,该机制定期将最近上下文转换为SSM块中的持久快速权重,清除KV缓存,从而在不增加推理延迟的情况下提升长期推理能力。
@TheTuringPost:本周必读研究 Harness-1:基于状态外化束带的搜索智能体的强化学习 R…
本文探讨了大型语言模型中持续学习的复兴,强调了离线整合(即“睡眠”)的必要性,以防止灾难性遗忘,并使模型在部署后能够保持更新和专业化。