用于摔跤的元学习

OpenAI Blog 论文

摘要

OpenAI 研究人员开发了元学习智能体,能够在多轮竞争性游戏中持续调整其策略,相比固定策略智能体展现出优异性能,并对环境和身体变化具有鲁棒性。

我们展示了在模拟机器人摔跤任务中,元学习智能体可以学会快速击败更强的非元学习智能体,同时证明元学习智能体能够适应物理故障。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:56

# 元学习在对抗中的应用 来源:https://openai.com/index/meta-learning-for-wrestling/ 为了测试我们的连续自适应方法,我们设计了 3 种类型的智能体——Ant(4条腿)、Bug(6条腿)和 Spider(8条腿)——并建立了一个多轮游戏,每个智能体与同一对手进行多场比赛,并在各轮之间调整其策略参数以更好地对抗对手的策略。在测试中,我们发现能够适应战术变化的智能体比策略固定的智能体竞争力强得多。在训练了一百多个智能体后,其中一些学会了固定策略,另一些学会了自适应,我们评估了每个智能体的适应度。 实时学习还可以让智能体应对自身身体的异常变化,比如适应自己的某些肢体随时间推移而逐渐失去功能。这表明我们可以使用这类技术来开发能够处理外部环境变化以及自身身体或内部状态变化的智能体。

相似文章

基于权重空间元学习的机器人策略自适应

Hugging Face Daily Papers

提出WIZARD,一种权重空间元学习框架,它从语言指令和演示视频中为冻结的VLA策略生成任务特定的LoRA参数,从而实现无需微调的高效任务自适应。

竞争性自我对弈

OpenAI Blog

OpenAI 证明在模拟 3D 机器人环境中进行竞争性自我对弈,能够使 AI 智能体在没有明确指导的情况下发现复杂的物理行为,如铲球、躲闪和虚晃等,表明自我对弈将成为未来强大 AI 系统的基础。