标签
SkillEvoReg引入了一个正则化框架,以防止语言模型代理的技能演化中的过拟合,结合了dropout、局部正则化和因果验证,以在控制技能增长的同时保持性能。
本文介绍EoupCT,一种通过估计并正交化未知预训练梯度来缓解大型语言模型持续微调中灾难性遗忘的新颖框架。
OpenAI开发者日预计将是一场重磅AI活动,届时可能发布具备持久记忆与持续学习能力的永在线AI智能体,并公布新硬件。
本文提出了随机通道重演 (RPR) 以约束在线持续学习中的重演间隙,展示了在像ER-ACE这样的经验回放方法中,其准确性优于独立类别平衡检索。
本文提出一种仿脑分层模块化持续学习方法,能处理在线不确定的数据流,利用预训练基础模型,在具身操作等任务中取得显著性能提升。
本文引入sheaf正则化以稳定去中心化SyncMap用于无监督连续分块,实现更高的归一化互信息和对输入分布偏移的更好适应。
Shopify 利用 PyTorch 和 vLLM 打造了持续学习闭环,用于优化其 GraphQL 智能体,通过生产环境驱动的更新,实现了成本降低96%,并超越了前沿模型的表现。
知识拉取请求(KPRs)是一个用于持续文档编写的框架,通过提取主张、过滤它们并生成更改日志来集成新知识,使更改可解释。在保留内容和添加信息方面,它优于现有方法,这在维基百科修订和RAGTIME任务中得到评估。
一个开源自主智能体在一项实验中已经运行超过50小时,处理了超过1亿token,旨在解决C(25,15,5)覆盖设计问题,目标是实现在数学上的突破。
该持续适应框架通过用户流量演化程序性记忆以用于代理式图形设计,在无需权重更新和人工标签的条件下提升执行成功率。
mini-AGI 是一个动态增长其架构的持续学习字节级语言模型,从头在8GB显存笔记本上训练,展示了个人AI持续学习而无灾难性遗忘的可能性。
本文介绍了ACLArena,这是一个用于评估多阶段后训练中智能体持续学习的框架,分析了遗忘和泛化机制,并提出了使用离线重放和LoRA专家的改进ACL方案。
本文介绍了持续企业世界模型发现,其中智能体在动态系统中学习并适应不断变化的业务规则,使用EnterpriseWorldShift基准进行评估,并展示了比先前方法更高的预测准确性。
本文提出了一种面向长时AI智能体的层级架构,结合了层级、滴答和级联智能,以实现持续运行而无遗忘,并在十天的活动中进行了验证。
本文提出一个统一的不确定性感知概率框架,用于在演化标签空间中进行持续新意图发现,采用自适应β-VAE和多信号决策机制,以实现可控的标签扩展,同时减轻灾难性遗忘。实验展示了高新颖性精度和稳定的适应性,遗忘程度有限。
ReDraft 是一种参考驱动修订方法,用于大型视觉语言模型的持续后训练,平衡新任务的学习和旧任务的保留,比SFT等标准方法实现更高的准确性和更少的遗忘。
本文提出动态检索策略生成(DRPG)框架,该框架利用记忆检索和环境反馈动态生成策略,以在多种任务中实现大型语言模型的持续改进。
CERA-MoA介绍了一个协同进化框架,用于混合代理系统,该框架使用强化学习动态路由查询并调整代理能力,从而提升任务性能和效率。