无反向传播的Pong:PC + 分布式赫布可塑性 vs. PPO:57% vs. 59%,约1500行从零开始 [P]
摘要
探索一个生物合理的赫布智能体在Pong游戏中能多接近PPO,发现仅有2%的差距,但指出自对弈下的灾难性遗忘是关键瓶颈。
想看看一个完全生物合理的智能体在Pong游戏中能多接近PPO。**设置** * 自定义Pong环境(pygame,无gym) * PPO基线:忠实于论文,从零开始 * 赫布智能体:用赫布价值估计替换PPO策略 * 手工特征 → 61% * BioAgent:预测编码用于特征学习 + 分布式赫布可塑性用于价值(Dabney等人,2020)→ 57% 整个流程中无反向传播。**关键观察** 1. 2%的差距虽小但真实。瓶颈并非缺失反向传播,而是自对弈中非平稳对手动力学下的灾难性遗忘。 2. 与标量赫布基线相比,分布式价值编码(类似Dabney)有助于稳定性,但不足以在自对弈中匹配PPO。 3. 自对弈严重暴露了可塑性-稳定性困境:快速适应的赫布规则也快速遗忘。这是非平稳设定下生物合理强化学习的真正障碍。不声称架构新颖性,因为这是一次从零开始的探索,旨在检验生物合理规则能否处理真实强化学习任务。简短回答:基本可以,但有一个明显的失败模式。代码:[github.com/nilsleut/Biologically-Plausible-RL-Plays-Pong](http://github.com/nilsleut/Biologically-Plausible-RL-Plays-Pong) 欢迎就预测编码实现、赫布价值估计器或自对弈设置提出问题。
相似文章
赫布架构AI模型 [R]
一个业余项目展示了一种赫布架构AI模型,该模型避免使用反向传播和梯度,在CIFAR-10上训练50个周期,展现出涌现行为,如准确率下降后跳升以及在针对性损伤后的恢复。
玩乒乓球的神经形态算法
一种神经形态算法通过打乒乓球展示了学习能力和想象力,其表现优于标准算法,并能适应反转的控制指令。该代码使用 POWER-KI 和 PWK-AI-WORKBENCH 通过 100% 氛围编程构建。
反应式玩法:实现了!!Atari Breakout 实验 [R]
在 Atari Breakout 上进行了 123 次失败的 PPO 实验后,添加一个简单的接近奖励来追踪球的下落,最终实现了反应式的、非脚本化的玩法,并且能够迁移到不熟悉的砖块布局上。
利用快慢后继特征平衡可塑性与稳定性
本文研究了渐变非平稳环境下强化学习中的稳定性-可塑性困境,发现通过跨多个时间尺度的突触巩固来稳定后继特征,其效果优于专注于可塑性的方法。
通过回放轨迹重建分区表示与生成随时间变化的关卡
提出了一种新颖的“蛋糕”表示法,用于随时间变化的游戏关卡,该表示法隐式编码了动态信息;同时提出了一种生成方法(回放轨迹重建分区法,PRP),在Sokoban游戏中,该方法在不牺牲求解多样性的前提下生成了有效关卡,性能优于六种最先进的PCG方法。