技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿
摘要
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
查看缓存全文
缓存时间: 2026/07/27 05:40
论文页面 - Skill Self-Play:通过共演技能推动大语言模型能力前沿
来源:https://huggingface.co/papers/2607.22529
发布于 7 月 24 日
今日论文 #2(https://huggingface.co/papers/date/2026-07-27)
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
大语言模型的训练正从人工设计与标注转向交互驱动的自我进化。然而,现有的自我进化方法面临任务多样性与验证可靠性之间的根本性矛盾:受环境约束的方法虽然能获得精确反馈,却将学习局限在狭窄领域;而开放式的自我生成虽然拓展了任务空间,但缺乏可靠的验证机制,导致误导性奖励污染训练循环。本文指出,智能体技能是调和这一矛盾的有力中间地带:每个技能确保在特定场景中实现深度且可验证的执行,而跨技能的动态路由则维持开放式的任务多样性。基于这一洞察,我们提出了 Skill Self-Play (Skill-SP),一个包含提议者、求解者和动态技能控制器的共演框架。通过强化学习循环进行编排,这些组件在连续的自演过程中共同演化:提议者根据动态采样的技能生成具有挑战性的任务;求解者探索候选解决方案以突破自身能力边界;技能控制器收集执行反馈来更新并扩展技能库。这种交互式共演有效弥合了结构化验证与开放式探索之间的鸿沟。在工具使用和推理基准上的实证评估表明,Skill-SP 作为一个稳健的进化引擎,能够持续推动强基模型的能力上限,同时显著扭转初始对齐不佳的模型。我们的代码可在 https://github.com/Qwen-Applications/skill-self-play 获取。
查看 arXiv 页面(https://arxiv.org/abs/2607.22529)
查看 PDF(https://arxiv.org/pdf/2607.22529)
GitHub(https://github.com/Qwen-Applications/skill-self-play)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.22529)
引用本论文的模型 0
暂无关联本论文的模型
请在模型 README.md 中引用 arxiv.org/abs/2607.22529 以建立关联。
引用本论文的数据集 0
暂无关联本论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2607.22529 以建立关联。
引用本论文的 Spaces 0
暂无关联本论文的 Space
请在 Space README.md 中引用 arxiv.org/abs/2607.22529 以建立关联。
包含本论文的收藏集 0
暂无包含本论文的收藏集
请将本论文添加到某个收藏集(https://huggingface.co/new-collection)以建立关联。
相似文章
OpenSkill:LLM智能体的开放世界自进化
OpenSkill是一个框架,让LLM智能体能够从开放世界资源中自进化技能和验证信号,无需目标任务监督,在多个基准测试中实现高性能。
重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合
本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents
This paper introduces SkillMisevo-Gym and SkillMisevo-Bench to study how self-improving LLM agents can evolve unsafe skills from compromised experience, plus SafeEvolve as a mitigation wrapper. Experiments across 25 agent-method configurations show skill misevolution is widespread and can persist across sessions, though SafeEvolve reduces fresh-session harm significantly.
SkillDAG:大规模LLM技能选择中的自进化类型化技能图
介绍了SkillDAG,一种用于大规模LLM技能选择的自进化类型化有向图,它建模了技能间关系,并允许智能体在执行过程中查询和演化该图,在ALFWorld和SkillsBench上优于基线。