关于一阶元学习算法
摘要
本文分析了用于少样本学习的一阶元学习算法,介绍了 Reptile 算法,并提供了对这些计算效率高的方法为何在既有基准上表现良好的理论见解。
暂无内容
查看缓存全文
缓存时间: 2026/04/20 14:56
# 关于一阶元学习算法
来源:https://openai.com/index/on-first-order-meta-learning-algorithms/
## 摘要
本论文研究了元学习问题,即存在一个任务分布,我们希望获得一个智能体,使其在面对从该分布中采样的前所未见的任务时表现良好(即学习快速)。我们分析了一系列算法,这些算法用于学习参数初始化,该初始化可以在新任务上快速微调,仅使用一阶导数进行元学习更新。该系列算法包括并推广了一阶 MAML,即通过忽略二阶导数得到的 MAML 近似。它还包括 Reptile,一种我们在此引入的新算法,该算法通过重复采样任务、在其上训练以及将初始化向该任务上的训练权重移动来工作。我们扩展了 Finn et al. 的成果,表明一阶元学习算法在一些公认的少样本分类基准上表现良好,并提供了旨在理解这些算法为何有效的理论分析。
相似文章
Reptile:可扩展的元学习算法
OpenAI 推出了 Reptile,一种用于少样本分类的可扩展元学习算法,性能与 MAML 相当,但收敛速度更快、方差更低。该论文提供了理论分析,表明 Reptile 通过最大化任务梯度的内积来改进泛化性能。
一种用于图少样本类增量学习的轻量级可塑性记忆框架
本文提出了一种用于图少样本类增量学习的轻量级可塑性记忆框架,该框架使用一种演化的微聚类结构和元学习,以在有限数据下平衡知识保留和对新类别的适应性。
@rohanpaul_ai:Meta 新论文。代码优化看起来像是强化学习的简单扩展:奖励正确的程序,然后……
Meta 的一篇论文分析了标准 RL 方法为何在代码优化上失败,并通过校准后的计时、问题相对排名以及 GRPO 改动重建了整个反馈流水线,将 Qwen 2.5 7B 的速度阈值从 18.0% 提升至 31.3%。
回放重要内容:用于高效LLM强化遗忘的离策略回放方法
本文介绍ReRULE,一种用于LLM强化遗忘的离策略回放方法,在RWKU和MUSE等基准测试中提高了遗忘与保留效率。
单次模仿学习
OpenAI 提出了一个元学习框架,用于单次模仿学习,使机器人能够从单个演示中学习新任务,并泛化到新实例而无需任务特定的工程设计。该方法使用软注意力机制,使在多样化任务对上训练的神经网络能够在测试时对看不见的任务表现良好。