标签
本文介绍了In-Place Test-Time Training,这是一个在推理过程中实时更新MLP权重的框架,使大语言模型能够动态适应并处理长达128k个令牌的长上下文。
本文提出Golden-GRPO Injection (GRIN),一种用于大语言模型持续知识注入的混合策略强化学习框架,克服了监督微调的局限性。实验表明,在知识吸收基准上表现卓越。
本文分析了循环快速权重记忆和选择性状态空间模型作为在线学习规则,推导出归一化更新族,这些更新族能改善长度外推并在语言建模中保持竞争力。
报告介绍了Thomson,一个通过持续学习训练的新通用AI模型,用于主权AI,展示了在高效计算下的竞争性能并解决了遗忘问题。
一篇名为'ContinualSkillBench'的研究论文发现,LLM智能体从延续上下文和反馈中获益更多,而不是维护显式技能库,其中顺序执行显示出16.9%的相对增益,但上下文学习往往优于技能维护。
这篇文章比较了冻结语言模型的离散和连续内存适配器,发现像EPMem这样的二进制掩码方法与连续方法一样容易忘记事实,强调写入/分配规则而非离散性是防止忘记的关键。
Google DeepMind强调了其15年来通过游戏推动人工智能发展的历史,并宣布与Fenris Creations建立研究合作伙伴关系,以应对持续学习和多智能体动态等开放挑战。
本文提出FedCurv-DR,一种轻量级的联邦持续学习方法,旨在减少遗忘并平衡性能、公平性和能效,以实现文化遗产应用中的可持续AI。
本文介绍了一种为持续学习系统设计的统计决策层,允许专家池根据累积证据决定是重用现有模型、生成新模型还是推迟,具有管理非平稳数据流的理论保证和系统贡献。
本文提出了一种新型神经架构4MAS,受生物双边性和记忆巩固启发,旨在解决终身学习中的灾难性遗忘问题,在基准数据集上取得了具有竞争力的结果。
本文提出了一种使用大型语言模型的频率感知持续学习框架,用于智能合约漏洞检测,通过FA-LoRA和APPM等高效方法解决适应、遗忘和整合挑战。
论文介绍了持续推理健身房,用于诊断和改进具有可验证奖励的持续强化学习(RLVR),提出了持续提示重放(CPR)以利用共享推理结构,达到多任务级性能。
本文识别了神经网络中由各向异性引起的可塑性损失,并提出了SingularClip,一种通过裁剪奇异值来维持持续学习和强化学习中可塑性的方法。
本文提出一种针对企业AI智能体的可逆遗忘方法来管理过时知识,引入一个框架,该框架包含记忆状态和控制器,根据相关性抑制和重新激活知识。
LangChain 将于9月2日在旧金山举办一场专注于持续学习的活动,包括技术演讲和社交机会。
本文介绍了经验链(CoE),一个通过测试时与自我和环境反馈的迭代交互来持续改进LLM的框架,在多个领域和模型中显示出一致的收益和更低的API成本。
本文介绍了间隔重复训练(SRT),一种用于语言模型持续预训练的框架,它使用受认知科学启发的自适应复习调度来缓解灾难性遗忘。它改善了稳定性-可塑性权衡,增强了旧知识的保留同时获取新信息。
Thomson-1.0-Small是汤森路透推出的一款开源基础模型,通过持续学习开发,旨在提升在法律、税务和新闻领域的性能,注重价值主权和效率。
介绍p-Spin Glass Network——一种全新的序列模型架构,它实现了内存高效、样本高效以及单批次稳定性,从而支持持续学习与边缘AI应用。
SynGAP 是一个无任务持续学习框架,通过自适应梯度预处理模拟生物元可塑性,以缓解灾难性遗忘,在基准测试中显示出相对于现有方法的显著准确性提升。