技能自我对弈(Skill Self-Play):通过协同进化技能推动大语言模型能力前沿

Hugging Face Daily Papers 论文

摘要

本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。

大语言模型的训练正从人工设计与标注转向交互驱动的自我进化。然而,现有自我进化方法面临任务多样性与验证可靠性之间的根本性困境:环境约束方法虽能获得精确反馈,却将学习限制于狭窄领域;开放式自我生成虽拓宽了任务空间,却缺乏可靠验证,导致误导性奖励污染训练循环。我们指出智能体技能是调和这一矛盾的强力中间地带:每个技能确保在特定场景下的深度、可验证执行,而技能间的动态路由则维持开放式任务多样性。基于这一洞察,我们提出了技能自我对弈(Skill Self-Play, Skill-SP),一个由提议者、求解者和动态技能控制器组成的协同进化框架。通过强化学习循环的编排,这些组件在持续的自我对弈循环中协同进化:提议者根据动态采样的技能生成具有挑战性的任务;求解者探索候选解决方案以推动其能力边界;技能控制器收集执行反馈以更新和扩展技能库。这种交互式协同进化有效桥接了结构化验证与开放式探索之间的鸿沟。在工具使用和推理基准测试上的实证评估表明,Skill-SP作为稳健的进化引擎,持续推动胜任基座模型的性能上限,同时为初始对齐不佳的模型催化显著的反转。我们的代码可在 https://github.com/Qwen-Applications/skill-self-play 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/27 05:40

论文页面 - Skill Self-Play:通过共演技能推动大语言模型能力前沿

来源:https://huggingface.co/papers/2607.22529
发布于 7 月 24 日

今日论文 #2(https://huggingface.co/papers/date/2026-07-27)

作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

大语言模型的训练正从人工设计与标注转向交互驱动的自我进化。然而,现有的自我进化方法面临任务多样性与验证可靠性之间的根本性矛盾:受环境约束的方法虽然能获得精确反馈,却将学习局限在狭窄领域;而开放式的自我生成虽然拓展了任务空间,但缺乏可靠的验证机制,导致误导性奖励污染训练循环。本文指出,智能体技能是调和这一矛盾的有力中间地带:每个技能确保在特定场景中实现深度且可验证的执行,而跨技能的动态路由则维持开放式的任务多样性。基于这一洞察,我们提出了 Skill Self-Play (Skill-SP),一个包含提议者、求解者和动态技能控制器的共演框架。通过强化学习循环进行编排,这些组件在连续的自演过程中共同演化:提议者根据动态采样的技能生成具有挑战性的任务;求解者探索候选解决方案以突破自身能力边界;技能控制器收集执行反馈来更新并扩展技能库。这种交互式共演有效弥合了结构化验证与开放式探索之间的鸿沟。在工具使用和推理基准上的实证评估表明,Skill-SP 作为一个稳健的进化引擎,能够持续推动强基模型的能力上限,同时显著扭转初始对齐不佳的模型。我们的代码可在 https://github.com/Qwen-Applications/skill-self-play 获取。

查看 arXiv 页面(https://arxiv.org/abs/2607.22529)
查看 PDF(https://arxiv.org/pdf/2607.22529)
GitHub(https://github.com/Qwen-Applications/skill-self-play)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.22529)

引用本论文的模型 0

暂无关联本论文的模型

请在模型 README.md 中引用 arxiv.org/abs/2607.22529 以建立关联。

引用本论文的数据集 0

暂无关联本论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2607.22529 以建立关联。

引用本论文的 Spaces 0

暂无关联本论文的 Space

请在 Space README.md 中引用 arxiv.org/abs/2607.22529 以建立关联。

包含本论文的收藏集 0

暂无包含本论文的收藏集

请将本论文添加到某个收藏集(https://huggingface.co/new-collection)以建立关联。

相似文章

OpenSkill:LLM智能体的开放世界自进化

Hugging Face Daily Papers

OpenSkill是一个框架,让LLM智能体能够从开放世界资源中自进化技能和验证信号,无需目标任务监督,在多个基准测试中实现高性能。

Practice Makes Unsafe: Skill Misevolution in Self-Improving LLM Agents

arXiv cs.AI

This paper introduces SkillMisevo-Gym and SkillMisevo-Bench to study how self-improving LLM agents can evolve unsafe skills from compromised experience, plus SafeEvolve as a mitigation wrapper. Experiments across 25 agent-method configurations show skill misevolution is widespread and can persist across sessions, though SafeEvolve reduces fresh-session harm significantly.