Skill0.5:面向智能体强化学习中分布外泛化的技能内化与利用联合框架
摘要
Skill0.5是一种新颖的智能体强化学习框架,通过动态难度感知路由器将通用技能内化与任务特定技能利用相结合,改进了复杂任务环境中的分布外泛化能力,在ALFWorld和WebShop上的实验证明了其效果。
查看缓存全文
缓存时间: 2026/05/29 07:00
论文页面 - Skill0.5:面向智能体强化学习分布外泛化的联合技能内化与利用
来源:https://huggingface.co/papers/2605.28424
摘要
Skill0.5 是一种新颖的智能体强化学习框架,通过动态难度感知路由器将通用技能内化与任务特定技能利用相结合,从而提升在复杂任务环境中的表现。
为大型语言模型配备显式技能已成为一种有前景的范式,使自主智能体能够解决复杂任务。智能体技能可自然分为两类:用于广泛认知迁移的通用技能,以及用于动态执行的任务特定技能。然而,现有的基于技能的强化学习 (https://huggingface.co/papers?q=skill-based%20reinforcement%20learning) (RL) 方法通常被迫在两种僵化模式之间选择:完全外部化(导致高昂的上下文开销)或完全内化(存在过拟合与知识冲突风险)。为解决这一困境,我们提出 Skill0.5——一种新颖的智能体 RL (https://huggingface.co/papers?q=agentic%20RL) 框架,通过将通用技能内化与任务特定技能利用相结合,明确区分不同技能的处理方式。由动态难度感知路由器驱动,Skill0.5 将任务分流至不同的精通等级 (https://huggingface.co/papers?q=mastery%20tiers),以应用量身定制的优化策略:对困难任务,它通过特权蒸馏 (https://huggingface.co/papers?q=privileged%20distillation) 内化通用技能,构建认知基础 (https://huggingface.co/papers?q=cognitive%20foundation);对简单任务,则使用诊断性探查 (https://huggingface.co/papers?q=diagnostic%20probing) 来惩罚捷径,强制进行特定技能利用。在 ALFWorld 和 WebShop 上的实验表明,Skill0.5 优于基于记忆和基于技能的 RL 基线,在分布内场景和分布外场景 (https://huggingface.co/papers?q=out-of-distribution%20scenarios) 中均实现了性能提升。
查看 arXiv 页面 (https://arxiv.org/abs/2605.28424) 查看 PDF (https://arxiv.org/pdf/2605.28424) GitHub (https://github.com/JasonZhujp/Skill0_5) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.28424)
在你的智能体中获取这篇论文:
hf papers read 2605.28424
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接这篇论文
请在模型 README.md 中引用 arxiv.org/abs/2605.28424,以在此页面建立链接。
引用该论文的数据集0
没有数据集链接这篇论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.28424,以在此页面建立链接。
引用该论文的 Space0
没有 Space 链接这篇论文
请在 Space README.md 中引用 arxiv.org/abs/2605.28424,以在此页面建立链接。
包含该论文的收藏集0
没有收藏集包含这篇论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,以在此页面建立链接。
相似文章
Skill1:通过强化学习实现技能增强型智能体的统一进化
Skill1 是一个统一框架,通过共享的任务结果目标,训练单一策略以协同进化技能选择、利用与蒸馏。在 ALFWorld 和 WebShop 上的实验表明,该框架在复杂任务环境中优于现有的基线方法。
SkillRise:面向跨任务技能演化的智能体强化学习
SkillRise 是一个统一的强化学习框架,使 LLM 智能体能够在相关且渐进难度的任务中学习并重用技能,在多个基准测试上比基线方法高出最多 8.5 个百分点。
技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用
提出了SelSkill,一个双粒度偏好学习框架,学习在智能体任务中何时调用技能,在ALFWorld上将任务成功率提升10.9%,在BFCL上提升5.7%。
学习可泛化的技能策略,基于数据高效的无监督强化学习
提出GenDa,一个统一的无监督强化学习框架,通过技能重新标记和互补信息瓶颈解决了非平稳技能语义和脆弱泛化问题,显著提高了数据效率和泛化能力。
SkillDAG:大规模LLM技能选择中的自进化类型化技能图
介绍了SkillDAG,一种用于大规模LLM技能选择的自进化类型化有向图,它建模了技能间关系,并允许智能体在执行过程中查询和演化该图,在ALFWorld和SkillsBench上优于基线。