标签
介绍了HExA,一个无需训练的框架,使LLM能够通过主动实验和技能复用来学习,在新的Interphyre物理基准测试中实现了高达77%的成功率,比现有智能体有大幅提升。
Matt Pocock 展示了他通过 AI 的 /teach 技能学会解魔方,证明 AI 能有效传授动手技能。
Memento-Skills 是一个自我进化的智能体框架,智能体从失败中学习并重写自己的技能,通过“读取-执行-反思-写入”循环不断改进。该框架在 HLE 和 GAIA 基准测试上进行了测试,并支持 Kimi、MiniMax、GLM 等开源大语言模型。
本文提出了SGDR(State-Grounded Dynamic Retrieval,状态感知动态检索),一种面向Web智能体的在线技能学习方法,支持逐步、感知当前状态的技能复用,而非静态的任务级检索。在WebArena上的实验表明,SGDR结合GPT-4.1可达到37.5%的成功率,相较于强基线取得了约10.6%的相对提升。
该论文提出 FluxMem,一种将智能体记忆视为不断演化的图结构,通过动态修复连接和提炼技能来提升记忆效果的系统。实验显示其在多个任务上优于现有方法,例如在 LoCoMo 上达到 95.06% 准确率,并在 GAIA 上相比 Kimi K2 提升 12.73 分。
SkillHarness 是一个框架,通过整合安全约束和自适应技能选择机制,使计算机使用代理能够在动态环境中安全地学习和执行技能,将不安全率降低了57.1%。
MMG2Skill通过闭环学习将网络上的过程性指南转化为智能体可执行的技能,在GUI操控、游戏玩法和纸牌游戏任务中提升了性能,宏平均提升了+12.8到+25.3个百分点。
本文介绍了“恒定上下文技能学习”,这是一种将程序性知识从提示词迁移到模型权重中的框架,旨在降低 LLM 智能体的 Token 使用量并提升隐私性。该方法在 ALFWorld 和 WebShop 等基准测试中表现出色,同时显著降低了推理成本。
OpenAI 研究人员提出了一个使用随机神经网络进行分层强化学习的框架,该框架通过代理奖励引导预训练有用的技能,然后利用这些技能在稀疏奖励或长期视界的下游任务中加速学习。