@andrew_n_carr: 事实证明,你可以在无需训练的情况下,将知识初始化到MLP中。Hazy Research刚刚表明,...
摘要
Hazy Research 表明,一个 MLP 可以在无需训练的情况下,通过嵌入知识进行初始化,然后一个 transformer 可以查询并使用该知识,这暗示了持续学习的能力。
事实证明,你可以在无需训练的情况下,将知识初始化到MLP中。
Hazy Research刚刚表明,如果正确执行,transformer可以查询并使用该知识!
持续学习??? https://t.co/W5CE8Gt84f
查看缓存全文
缓存时间: 2026/07/24 05:20
原来你可以将知识直接初始化到MLP中,无需训练。
Hazy Research最近发现,如果处理得当,transformer可以查询并利用这些知识!
持续学习??? https://t.co/W5CE8Gt84f
相似文章
MLP是Hebbian的:为Transformer构建高效的事实存储MLP
本文从理论上阐述了Transformer中的MLP如何以信息论最优速率存储事实,并提供了一种闭式构造方法,该方法以远少于先前方法的参数实现最优存储容量,并支持模块化事实编辑。
@TeachTheMachine: 使用Transformer模型:从训练到推理
本教程介绍如何使用Transformer模型,从训练到推理,重点讲解自回归生成、prefill(预填充)与decode(解码)阶段,以及用于高效推理的键值缓存。
@rohanpaul_ai: @NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识…
来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。
@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
@swyx: 同感。一个非常方便的思维框架,用于理解transformer当前擅长学习哪些类型,以及它为何会遇到限制…
文章讨论了一个理解transformer学习优势及其局限性的思维框架,认为相对于能够假设并寻求真相的方法,扩展当前范式可能效率低下,并提及了对对抗性世界模型和强化学习的需求。