agent-learning

标签

Cards List
#agent-learning

EpiCon: 通过协同进化多模态记忆的集体智能体学习

Hugging Face Daily Papers ↗ · 昨天 缓存

EpiCon 提出一个共享的多模态记忆框架,用于AI智能体之间的集体学习,在不更新宿主模型参数的情况下,提升了十一个基准测试的性能。

0 人收藏 0 人点赞
#agent-learning

ACLArena:多阶段后训练中的智能体持续学习

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

本文介绍了ACLArena,这是一个用于评估多阶段后训练中智能体持续学习的框架,分析了遗忘和泛化机制,并提出了使用离线重放和LoRA专家的改进ACL方案。

0 人收藏 0 人点赞
#agent-learning

ScienceIDE:将全球科学代码库转化为智能体可学习环境

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

ScienceIDE引入了基础设施,用于将科学代码仓库转化为科学智能体的可编程环境,支持任务生成、执行和验证,训练后的模型在科学代码修复和通用能力方面均有提升。

0 人收藏 0 人点赞
#agent-learning

训练需要可信的世界:用于智能体学习的验证合成网络环境

arXiv cs.AI ↗ · 2026-08-25 缓存

本文介绍了一个构建验证合成网络环境的框架,以改进网络智能体的训练,展示了在基准测试中增强的性能和可迁移性。

0 人收藏 0 人点赞
#agent-learning

EnvHarness: 唤醒静态世界以用于智能体学习

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

EnvHarness 引入了一个可编程层,用于动态重塑静态环境以进行强化学习,通过 EnvRigger 自动针对弱点来提升智能体性能。

0 人收藏 0 人点赞
#agent-learning

有没有其他人尝试过不进行微调来训练智能体网络?

Reddit r/AI_Agents ↗ · 2026-07-29

作者分享了一个确定性学习框架,它通过将成功的策略提升为持久化的剧本,让多智能体系统在不进行微调或提示词编辑的情况下跨回合改进。在 Mini Amusement Park 基准测试上,奖励从 12,121 提升到 483,019,达到了排行榜第一名。

0 人收藏 0 人点赞
#agent-learning

基于智能体经验的高效样本学习

Hugging Face Daily Papers ↗ · 2026-07-23 缓存

提出Experience Distillation方法,该方法将在智能体交互历史中通过上下文学习获得的增益内化到模型权重中,无需额外的环境交互,在软件工程和文字冒险任务上实现了显著的样本效率提升。

0 人收藏 0 人点赞
#agent-learning

@akshay_pachaar: Hermes /learn 解释。代理通常以艰难的方式学习。他们在实时执行任务时挣扎,失败几次,找到…

X AI KOLs Timeline ↗ · 2026-06-25 缓存

Nous Research 的 Hermes Agent 引入了 /learn,这是一个命令,允许代理从文档、代码或指令中刻意创建技能,而无需先完成任务失败,将任何来源转化为可重复使用的技能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈