self-play

标签

Cards List
#self-play

@heyshrutimishra: 最可怕的部分不是机器人,而是140年的练习在几周内于计算机中发生。这就是未来所有技能的学习方式……

X AI KOLs Timeline ↗ · 昨天 缓存

Skild AI演示了一个通过自我对弈模拟训练的机器人进行足球训练,模拟了相当于140年的练习在几周内完成,展示了通过计算机模拟获取技能的新方法。

0 人收藏 0 人点赞
#self-play

Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球。

Reddit r/singularity ↗ · 昨天

Skild AI 通过模拟140年与自身过去版本的对练,训练了Unitree G1机器人踢足球,展示了人工智能和机器人技术的重大进展。

0 人收藏 0 人点赞
#self-play

基于多样性剪枝测试的信息增益奖励:GT锚定验证器协同训练用于可靠代码生成

arXiv cs.AI ↗ · 3天前 缓存

本文介绍了CoVer,一个用于代码生成的协同训练框架,它通过使用信息增益奖励和多样性剪枝测试来解决自博弈强化学习的失败问题,在基准测试上实现了通过率的显著提升。

0 人收藏 0 人点赞
#self-play

DiagEvo: 基于层级错误记忆的诊断引导自进化

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

DiagEvo通过层级错误原因记忆和双重置信度过滤,从内部失败历史中推导训练方向,从而改善语言模型的自进化,其性能优于依赖外部资源的基线方法。

0 人收藏 0 人点赞
#self-play

ShuttleArena:基于物理的羽毛球中可解释的自对弈

arXiv cs.LG ↗ · 2026-08-27 缓存

本文介绍了ShuttleArena,一个基于物理的羽毛球自对弈环境,其中代理使用PPO学习可解释的战术策略,在击球选择和恢复方面显示出竞争性改进。

0 人收藏 0 人点赞
#self-play

追逐即课程,捕捉锚定奖励:面向零数据LLM推理的追逐-逃避自我对弈

arXiv cs.CL ↗ · 2026-08-25 缓存

LURE引入了一种用于LLM推理的零数据自我对弈框架,该框架使用追逐-逃避游戏来动态调整任务难度并提供密集奖励,在多种环境中超越基线。

0 人收藏 0 人点赞
#self-play

SPADE:自适应合成可执行环境中的自我博弈

Hugging Face Daily Papers ↗ · 2026-08-19 缓存

SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。

0 人收藏 0 人点赞
#self-play

从 RLVR 到 RLSVR(GitHub 仓库)

TLDR AI ↗ · 2026-08-04 缓存

介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。

0 人收藏 0 人点赞
#self-play

自我对弈遇上技能进化:能提问、求解并记忆的自进化搜索代理

arXiv cs.AI ↗ · 2026-08-03 缓存

本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。

0 人收藏 0 人点赞
#self-play

@Xudong07452910: 让模型自己出题、自己解题、自己训练,最怕的就是把错误题目也一起学进去。 Qwen 团队这篇论文提出 Skill Self-Play,给模型的自我进化加入了一套会持续更新的技能库。 训练中有三个角色: Proposer 根据技能生成刚好有挑…

X AI KOLs Timeline ↗ · 2026-08-02 缓存

Qwen 团队提出 Skill Self-Play 框架,通过 Proposer、Solver 和动态技能控制器协同自我对弈,在工具调用和推理任务上显著提升模型能力。

0 人收藏 0 人点赞
#self-play

让Kimi K3一次性构建一个完整的三国卡牌构筑类Roguelike游戏,然后通过上万次自对弈来调整自身平衡

Reddit r/ArtificialInteligence ↗ · 2026-07-28

用户报告称,Kimi K3(一个AI模型)能够一次性生成一个完整的三国卡牌构筑类Roguelike游戏,然后通过上万次自对弈来自动调整平衡性。

0 人收藏 0 人点赞
#self-play

GPT-Red:通过规模化自我对弈实现自动化红队测试

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。

0 人收藏 0 人点赞
#self-play

从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励

Hugging Face Daily Papers ↗ · 2026-07-26 缓存

本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。

0 人收藏 0 人点赞
#self-play

揭秘GPT-Red:OpenAI为提升模型安全而打造的LLM超级黑客

MIT Technology Review ↗ · 2026-07-15 缓存

OpenAI开发了GPT-Red,这是一个通过自对弈训练、能够自动对其他模型进行红队测试的LLM,发现了如新型'虚假思维链'提示注入等漏洞。该方法提升了GPT-5.6的鲁棒性。

0 人收藏 0 人点赞
#self-play

GPT-Red: 解锁自我改进以增强鲁棒性

OpenAI Blog ↗ · 2026-07-15 缓存

OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。

0 人收藏 0 人点赞
#self-play

幻觉自我对弈:通过进化生成器引导强化检测器

arXiv cs.CL ↗ · 2026-07-10 缓存

介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。

0 人收藏 0 人点赞
#self-play

一项关于轻量级游戏智能体强大因素的黄金标准研究

arXiv cs.LG ↗ · 2026-07-09 缓存

本文研究了在不完美信息纸牌游戏中训练轻量级强化学习智能体的设计选择,使用固定的基于规则的专家作为基准,针对金拉米和勒德克德州扑克。研究发现,信任区域更新、精心设计的奖励、课程学习、热启动和检查点保留能提升性能,而奖励塑形和大语言模型对手等几种常见技术并无帮助。

0 人收藏 0 人点赞
#self-play

@carolineschoi:我今天会在A厅的海报展示区,时间是韩国标准时间下午5点到7点45分。如果你想聊聊合成数据、自博弈或……欢迎来打个招呼!

X AI KOLs Following ↗ · 2026-07-08 缓存

提出锚定自博弈(ASP)方法,通过生成器-修复器自博弈,结合嵌入相似度奖励和参考错误混合,来扩展代码修复监督,在全新基准测试BugSourceBench上,相较于标准自博弈,修复率相对提升24%。

0 人收藏 0 人点赞
#self-play

更令人信服,而非更正确:无参考LLM评判者的自我博弈奖励操纵

arXiv cs.LG ↗ · 2026-07-08 缓存

本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。

0 人收藏 0 人点赞
#self-play

无人机集群通过自我对弈学习近战与远程战斗战术

Reddit r/ArtificialInteligence ↗ · 2026-07-07

本研究探索使用自我对弈强化学习,使无人机集群能够在无需人工干预的情况下自主开发近战和远程战斗战术。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈