标签
Skild AI演示了一个通过自我对弈模拟训练的机器人进行足球训练,模拟了相当于140年的练习在几周内完成,展示了通过计算机模拟获取技能的新方法。
Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球,展示了人工智能和机器人技术的重大进展。
本文介绍了CoVer,一个用于代码生成的协同训练框架,它通过使用信息增益奖励和多样性剪枝测试来解决自博弈强化学习的失败问题,在基准测试上实现了通过率的显著提升。
DiagEvo通过层级错误原因记忆和双重置信度过滤,从内部失败历史中推导训练方向,从而改善语言模型的自进化,其性能优于依赖外部资源的基线方法。
本文介绍了ShuttleArena,一个基于物理的羽毛球自对弈环境,其中代理使用PPO学习可解释的战术策略,在击球选择和恢复方面显示出竞争性改进。
LURE引入了一种用于LLM推理的零数据自我对弈框架,该框架使用追逐-逃避游戏来动态调整任务难度并提供密集奖励,在多种环境中超越基线。
SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。
本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。
Qwen 团队提出 Skill Self-Play 框架,通过 Proposer、Solver 和动态技能控制器协同自我对弈,在工具调用和推理任务上显著提升模型能力。
用户报告称,Kimi K3(一个AI模型)能够一次性生成一个完整的三国卡牌构筑类Roguelike游戏,然后通过上万次自对弈来自动调整平衡性。
本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
OpenAI开发了GPT-Red,这是一个通过自对弈训练、能够自动对其他模型进行红队测试的LLM,发现了如新型'虚假思维链'提示注入等漏洞。该方法提升了GPT-5.6的鲁棒性。
OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。
介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。
本文研究了在不完美信息纸牌游戏中训练轻量级强化学习智能体的设计选择,使用固定的基于规则的专家作为基准,针对金拉米和勒德克德州扑克。研究发现,信任区域更新、精心设计的奖励、课程学习、热启动和检查点保留能提升性能,而奖励塑形和大语言模型对手等几种常见技术并无帮助。
提出锚定自博弈(ASP)方法,通过生成器-修复器自博弈,结合嵌入相似度奖励和参考错误混合,来扩展代码修复监督,在全新基准测试BugSourceBench上,相较于标准自博弈,修复率相对提升24%。
本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。