标签
EpiCon 提出一个共享的多模态记忆框架,用于AI智能体之间的集体学习,在不更新宿主模型参数的情况下,提升了十一个基准测试的性能。
本文介绍了ACLArena,这是一个用于评估多阶段后训练中智能体持续学习的框架,分析了遗忘和泛化机制,并提出了使用离线重放和LoRA专家的改进ACL方案。
ScienceIDE引入了基础设施,用于将科学代码仓库转化为科学智能体的可编程环境,支持任务生成、执行和验证,训练后的模型在科学代码修复和通用能力方面均有提升。
本文介绍了一个构建验证合成网络环境的框架,以改进网络智能体的训练,展示了在基准测试中增强的性能和可迁移性。
EnvHarness 引入了一个可编程层,用于动态重塑静态环境以进行强化学习,通过 EnvRigger 自动针对弱点来提升智能体性能。
作者分享了一个确定性学习框架,它通过将成功的策略提升为持久化的剧本,让多智能体系统在不进行微调或提示词编辑的情况下跨回合改进。在 Mini Amusement Park 基准测试上,奖励从 12,121 提升到 483,019,达到了排行榜第一名。
提出Experience Distillation方法,该方法将在智能体交互历史中通过上下文学习获得的增益内化到模型权重中,无需额外的环境交互,在软件工程和文字冒险任务上实现了显著的样本效率提升。
Nous Research 的 Hermes Agent 引入了 /learn,这是一个命令,允许代理从文档、代码或指令中刻意创建技能,而无需先完成任务失败,将任何来源转化为可重复使用的技能。