heuristic-learning

标签

Cards List
#heuristic-learning

@Gorden_Sun: 通过coding agent实现启发式学习 用coding agent持续维护和迭代一套程序化策略系统,取代神经网络的梯度更新,在测试中,达到了Deep RL基线水平。可能成为“预训练→RLHF→大规模RL”之后的下一个范式。 过去就有启…

X AI KOLs Timeline · 2026-05-09 缓存

文章提出利用coding agent维护和迭代程序化策略系统以取代神经网络梯度更新,在Deep RL测试中达到基线水平,被视为继预训练和RLHF之后的潜在新范式。

0 人收藏 0 人点赞
#heuristic-learning

@0xLogicrw: OpenAI 后训练核心成员翁家翌(Jiayi Weng)以个人名义提出了一种名为「启发式学习」的强化学习新范式,并开源了全部实验代码。他用 Codex(GPT-5.4)反复玩 Atari 打砖块游戏,但 GPT-5.4 自始至终没有被重…

X AI KOLs Timeline · 2026-05-08

前OpenAI研究员翁家翌提出“启发式学习”新范式,利用大模型生成并迭代修改Python代码解决强化学习任务,将知识存储在可解释的代码中而非神经网络参数,有效避免灾难性遗忘,目前已在Atari和MuJoCo基准上取得优异成果并开源代码。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈