标签
SPACE 通过从成功轨迹归纳两层参数化技能,将子技能边界作为动作块监督,训练长程 LLM Agent 自适应输出可变长原子动作序列;在 ALFWorld 和 ScienceWorld 上成功率提升 7.0%–31.3%,决策轮次最多降低 78.9%。
介绍了QDOS,这是一个用于离线到在线强化学习的统一流水线,采用优势加权质量-多样性预训练来提取多样且高价值的技能,显著提升了操作和移动任务的性能。
本文介绍了一种利用AI工具从博主内容中提取思想并形成可复用技能流程的方法。
SAGE是一个利用自演化规则和属性引导更新来自动化短剧制作中分镜生成的框架,实现了专家级性能,并在商业部署中减少了制作时间。
Introduces ERSkill, a retrieval-centric framework for self-evolving, skill-guided adaptive memory access in LLM agents. It co-evolves retrieval skills and a routing policy, substantially outperforming strong baselines across agent memory benchmarks.
This paper argues that representing agent skills as code, rather than natural language, yields the best cost reduction for LLM agents, and introduces SpeedRunner, a coding agent that learns programmatic skills from past trajectories to improve performance while cutting costs across embodied environments.
介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。
本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。
一篇综述论文,将机器人学习技术按照“冻结权重策略(VLA模型)”与“以代码形式自行编写可执行技能的智能体”这一轴线进行组织,提供了自我改进机制的分类法,并分析了新兴的机器人技能经济。
Qwen 团队提出 Skill Self-Play 框架,通过 Proposer、Solver 和动态技能控制器协同自我对弈,在工具调用和推理任务上显著提升模型能力。
SkillRise 是一个统一的强化学习框架,使 LLM 智能体能够在相关且渐进难度的任务中学习并重用技能,在多个基准测试上比基线方法高出最多 8.5 个百分点。
一条推文线程描述了如何构建一个“AI代理联盟”,它们可以互相发现、共享上下文,并通过代理间通信学习技能。
本文介绍了技能自我对弈(Skill-SP),这是一个协同进化框架,利用提议者、求解者和技能控制器来桥接结构化验证与开放式探索,从而提升大语言模型在工具使用和推理基准测试中的性能。
Claude上线Record a Skill功能,用户通过录制屏幕并口述操作步骤即可教会Claude执行复杂任务,无需编写代码或提示词,大幅降低AI技能创建门槛。
介绍了RELIC,一种通过揭示原理在多智能体规划中学习可解释且可组合技能的框架,实现了隐私保护的协调和跨智能体技能迁移,无需共享代码。
本文介绍了EvoClawBench,一个旨在测试AI智能体能否从自身执行运行中学习可复用技能的基准测试。多个智能体运行时的实验表明,技能学习具有选择性和成本敏感性,并非自动受益。
据报道,一位年薪170万美元的Anthropic工程师认为,内存与检索架构技能是AI工程师最有价值的技能,薪资范围从提示词工程师的9万美元到系统架构师的七位数以上。
介绍了层次化实验者智能体(HExA),这是一个基于上下文、以实验为中心的自我改进框架,使LLM智能体能够设计实验、学习可复用技能,并在新领域回答查询,在Interphyre物理模拟基准上取得了显著优于基线的改进。
介绍了一种名为'skill neologisms'的方法,它能使LLMs在不更新权重的情况下学习新技能,解决了灾难性遗忘问题。该方法在ICML上提出。
推文分享了ChatGPT的'无限私教'隐藏模式,声称能在3小时内教会任何技能,并附带了8个实用的提示词。