@neural_avb:这就是经过5-6小时自对弈强化学习训练所能达到的效果——智能体通过激光雷达查看弹丸…
摘要
一个帖子分享了在Unity中使用激光雷达和PPO进行自对弈RL训练的视频,随后是关于从零构建AlphaGo的讲座。
查看缓存全文
缓存时间: 2026/05/16 23:24
这是你仅用5-6小时自我博弈强化学习训练就能达到的效果:
智能体通过激光雷达扫描观察弹丸,利用PPO策略选择动作,并在迭代式自我改进循环中与自身过往版本对抗。
使用Unity与MLAgents制作。
Git仓库已在10分钟前上线:
在此处体验游戏(当然免费):
我选用激光雷达扫描,是因为它们既是空间感知信号,又是固定长度向量——与一维卷积网络配合良好。
坐标数据理论上也可以使用,前提是你对观测向量做某种处理,使其长度固定/与子弹数量无关(比如某种注意力网络)。
我很快就会开源代码。
初期曾使用GAIL算法基于人类数据进行预训练(通过示范行为)。
之后它就变成一个强化学习环境——它并非像你可能想象的那样学习键盘按键操作。它拥有一些可执行动作(移动、跳跃、蹲伏、冲刺等),并学会根据当前状态映射应执行哪个动作。
哈哈,你以前研究过自我博弈?还是Unity?
这大概是三四年前的事了……我现在完全不知道MLAgents的进展!
厉害!
相似文章
@dair_ai: // 自对弈加上一点人类数据 // 结合人类演示和自对弈强化学习的超酷论文。30分钟…
一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。
@dwarkesh_sp: 与 @ericjang11 的新黑板讲座:他演示了如何用现代AI工具从头构建AlphaGo。一些…
Eric Jang的黑板讲座逐步讲解了如何使用现代AI工具从零构建AlphaGo,涵盖了强化学习、蒙特卡洛树搜索、自我对弈,并与LLM训练相联系,同时讨论了自动化AI研究。
自我对弈帮助AI在围棋中达到超人类水平,那么为何对LLM未能如此?研究人员找到了解决方案。
研究人员引入了自导自对弈(Self-Guided Self-Play, SGS),这是一种用于LLM的自我对弈算法,通过使用指引角色(Guide)对合成问题进行评分来防止奖励作弊(reward hacking)。应用于Lean4中的定理证明时,SGS超越了强化学习基线,并使7B模型胜过671B模型。
@ericjang11: 在过去的几个月里,我一直在从零实现AlphaGo,这是2016年的一项AI突破,它启发了我……
Eric Jang发布了AutoGo,一个从零实现AlphaGo的教程,包含代码和一个可对弈的机器人,展示了前沿能力现在可以低成本复现。
竞争性自我对弈
OpenAI 证明在模拟 3D 机器人环境中进行竞争性自我对弈,能够使 AI 智能体在没有明确指导的情况下发现复杂的物理行为,如铲球、躲闪和虚晃等,表明自我对弈将成为未来强大 AI 系统的基础。