self-play

标签

Cards List
#self-play

@maxrumpf: 人类是低上限

X AI KOLs Timeline ↗ · 2026-07-07 缓存

Max Rumpf 认为,在训练先进AI模型时,人类反馈正变得过时,他引用了国际象棋、数学和搜索等例子。他主张使用自我对弈和合成数据等无需人类的方法,而Will Depue的一条引用推文则呼吁建立与计算规模相平行的大规模数据基础设施。

0 人收藏 0 人点赞
#self-play

我用自对弈强化学习制作了一个超人类水平的 Generals.io 智能体 [P]

Reddit r/MachineLearning ↗ · 2026-06-24

使用基于 JAX 的流水线和 Vision Transformer,通过自对弈强化学习训练了一个超人类水平的 Generals.io 智能体。在人类 1v1 排行榜上排名第一;所有代码和一个快速的 JAX 模拟器均已开源。

0 人收藏 0 人点赞
#self-play

EMAgnet:大型游戏中策略梯度自我博弈的参数空间EMA正则化

arXiv cs.LG ↗ · 2026-06-24 缓存

EMAgnet针对大型两人零和游戏中的策略梯度自我博弈引入了参数空间指数移动平均正则化,与均匀正则化目标相比,实现了更低的可利用性。

0 人收藏 0 人点赞
#self-play

@dair_ai: // 自对弈加上一点人类数据 // 结合人类演示和自对弈强化学习的超酷论文。30分钟…

X AI KOLs Following ↗ · 2026-06-20 缓存

一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。

0 人收藏 0 人点赞
#self-play

@VukRosic99: DeepSeek 研究员刚刚开源了他的个人项目 AutoResearch。该项目首次实现了自动化研究代理...

X AI KOLs Timeline ↗ · 2026-06-18 缓存

DeepSeek 研究员开源了 AutoResearch,这是一个自主框架,能够在无需人工干预的情况下,为 DeepSeek 285B 模型规划、执行并调试强化学习实验,并附带了一篇关于自我对弈的综述论文。

0 人收藏 0 人点赞
#self-play

@teortaxesTex: Deli 开源了他的 AutoResearch。

X AI KOLs Timeline ↗ · 2026-06-17 缓存

Deli Chen 开源了他的 AutoResearch SKILL 工具,并发布了一篇受 AlphaZero 启发的关于自博弈(Self-play)的综述论文。

0 人收藏 0 人点赞
#self-play

@victor207755822:Deli AutoResearch SKILL 现已正式开源!https://victorchen96.github.io/auto_research/framework.html… 还有…

X AI KOLs Timeline ↗ · 2026-06-17 缓存

Deli AutoResearch SKILL 已开源,这是一个自主框架,可自动化 GPU 实验和强化学习流水线,同时附带一篇关于自我对弈的综述论文。

0 人收藏 0 人点赞
#self-play

通过自我对弈发现格基约简策略

arXiv cs.LG ↗ · 2026-06-16 缓存

本文提出Delta-Star,一种采用AlphaZero风格自我对弈的深度强化学习方法,通过与LLL算法的原始操作交互,发现更优的格基约简策略。学习到的策略无需重新训练即可泛化到更高维度和未见过的模数。

0 人收藏 0 人点赞
#self-play

Big 2中不完美信息下的自我对弈强化学习

arXiv cs.LG ↗ · 2026-05-29 缓存

本文提出了一个针对四人制不完美信息纸牌游戏Big 2的自我对弈强化学习框架,比较了策略梯度和基于价值的方法,并发现带有熵正则化的PPO优于其他方法。

0 人收藏 0 人点赞
#self-play

SCOPE:通过共同进化策略进行开放式任务的自我对弈

Hugging Face Daily Papers ↗ · 2026-05-29 缓存

SCOPE是一个用于开放式任务的自我对弈框架,它共同进化挑战者(Challenger)和求解器(Solver)策略,在没有外部监督的情况下,在基准测试上取得了高达+10.4分的提升。

0 人收藏 0 人点赞
#self-play

@rohanpaul_ai: 精彩新论文来自Meta、CMU及其他实验室。表明编码代理通过制造自己的...来更快地提升。

X AI KOLs Following ↗ · 2026-05-26 缓存

来自Meta、CMU及其他实验室的一篇新论文提出了Self-play SWE-RL,这是一种方法,编码代理通过在实际代码库中制造和修复错误来训练自己,在SWE-bench基准测试上取得了显著提升,且不依赖人类编写的任务。

0 人收藏 0 人点赞
#self-play

CoSPlay:测试时基于自生成代码和单元测试的协作式自博弈

Hugging Face Daily Papers ↗ · 2026-05-22 缓存

CoSPlay 是一个免训练框架,通过协作式自博弈同时提升代码生成与单元测试质量,在无需真实单元测试的情况下达到了具有竞争力的性能。

0 人收藏 0 人点赞
#self-play

无反向传播的Pong:PC + 分布式赫布可塑性 vs. PPO:57% vs. 59%,约1500行从零开始 [P]

Reddit r/MachineLearning ↗ · 2026-05-19

探索一个生物合理的赫布智能体在Pong游戏中能多接近PPO,发现仅有2%的差距,但指出自对弈下的灾难性遗忘是关键瓶颈。

0 人收藏 0 人点赞
#self-play

自对弈强化学习中决策能力结构性阈值决定崩溃

arXiv cs.LG ↗ · 2026-05-19 缓存

本文发现了一个决策能力阈值,它决定了自对弈强化学习智能体在非对称规则扰动下是否会崩溃。研究表明,消除所有正可达应急决策会导致快速收敛到一个确定性利用吸引子。

0 人收藏 0 人点赞
#self-play

当动作消失:自对弈强化学习中的对抗性动作移除

arXiv cs.LG ↗ · 2026-05-19 缓存

本文研究了自对弈强化学习中的对抗性动作掩蔽,攻击者选择性移除受害者动作集中的合法动作。实验表明,在多个环境和算法下,该攻击比随机掩蔽或扰动基线造成的损害显著更大,且受害者即使在长时间训练后也无法恢复。

0 人收藏 0 人点赞
#self-play

PopuLoRA: 用于推理自我博弈的LLM种群协同进化

arXiv cs.AI ↗ · 2026-05-19 缓存

PopuLoRA 提出了一种基于种群的非对称自我博弈框架,用于 LLM 的 RLVR 后训练。在该框架中,教师和学生 LoRA 适配器协同进化,生成日益复杂的问题,从而克服了单智能体自我博弈的自我校准限制。

0 人收藏 0 人点赞
#self-play

太棒了。说真的,人们对这个平台很苛刻,但如果你小心选择关注的人,它就是一个持续的……

X AI KOLs Timeline ↗ · 2026-05-16 缓存

Eric Jang 宣布他一直在从头实现 AlphaGo,这个 2016 年的 AI 突破曾激励他进入深度学习领域。

0 人收藏 0 人点赞
#self-play

@neural_avb:这就是经过5-6小时自对弈强化学习训练所能达到的效果——智能体通过激光雷达查看弹丸…

X AI KOLs Timeline ↗ · 2026-05-16 缓存

一个帖子分享了在Unity中使用激光雷达和PPO进行自对弈RL训练的视频,随后是关于从零构建AlphaGo的讲座。

0 人收藏 0 人点赞
#self-play

@Michaelzsguo: 这是我最近看到的关于强化学习基础,以及它和现代 AI 关系的最好深度讨论之一。 Eric Jang 和 Dwarkesh 把一个看起来有点复古的练习,也就是用今天的工具重新构建 AlphaGo,变成了一堂非常清晰的大师课:为什么“搜索 +…

X AI KOLs Timeline ↗ · 2026-05-15 缓存

A detailed discussion on reinforcement learning and its connection to modern AI, using the reconstruction of AlphaGo with modern tools as a clear example of search and self-play. Key takeaways include neural network amortization of search, credit assignment challenges in LLMs vs AlphaGo, and implications for automated research.

0 人收藏 0 人点赞
#self-play

自我对弈帮助AI在围棋中达到超人类水平,那么为何对LLM未能如此?研究人员找到了解决方案。

Reddit r/singularity ↗ · 2026-05-15

研究人员引入了自导自对弈(Self-Guided Self-Play, SGS),这是一种用于LLM的自我对弈算法,通过使用指引角色(Guide)对合成问题进行评分来防止奖励作弊(reward hacking)。应用于Lean4中的定理证明时,SGS超越了强化学习基线,并使7B模型胜过671B模型。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈