@neural_avb:这就是经过5-6小时自对弈强化学习训练所能达到的效果——智能体通过激光雷达查看弹丸…

X AI KOLs Timeline 新闻

摘要

一个帖子分享了在Unity中使用激光雷达和PPO进行自对弈RL训练的视频,随后是关于从零构建AlphaGo的讲座。

这就是经过5-6小时自对弈RL训练所能达到的效果。 顺便说一下,智能体通过激光雷达扫描观察弹丸,使用PPO策略选择动作,并在迭代的自我改进循环中与过去的版本竞争。 使用Unity和MLAgents制作。https://t.co/EDnZXXW6Fz
查看原文
查看缓存全文

缓存时间: 2026/05/16 23:24

这是你仅用5-6小时自我博弈强化学习训练就能达到的效果:

智能体通过激光雷达扫描观察弹丸,利用PPO策略选择动作,并在迭代式自我改进循环中与自身过往版本对抗。

使用Unity与MLAgents制作。

Git仓库已在10分钟前上线:

在此处体验游戏(当然免费):

我选用激光雷达扫描,是因为它们既是空间感知信号,又是固定长度向量——与一维卷积网络配合良好。

坐标数据理论上也可以使用,前提是你对观测向量做某种处理,使其长度固定/与子弹数量无关(比如某种注意力网络)。

我很快就会开源代码。

初期曾使用GAIL算法基于人类数据进行预训练(通过示范行为)。

之后它就变成一个强化学习环境——它并非像你可能想象的那样学习键盘按键操作。它拥有一些可执行动作(移动、跳跃、蹲伏、冲刺等),并学会根据当前状态映射应执行哪个动作。

哈哈,你以前研究过自我博弈?还是Unity?

这大概是三四年前的事了……我现在完全不知道MLAgents的进展!

厉害!

相似文章

竞争性自我对弈

OpenAI Blog

OpenAI 证明在模拟 3D 机器人环境中进行竞争性自我对弈,能够使 AI 智能体在没有明确指导的情况下发现复杂的物理行为,如铲球、躲闪和虚晃等,表明自我对弈将成为未来强大 AI 系统的基础。