@andrew_n_carr: 事实证明,你可以在无需训练的情况下,将知识初始化到MLP中。Hazy Research刚刚表明,...
摘要
Hazy Research 表明,一个 MLP 可以在无需训练的情况下,通过嵌入知识进行初始化,然后一个 transformer 可以查询并使用该知识,这暗示了持续学习的能力。
查看缓存全文
缓存时间: 2026/07/24 05:20
原来你可以将知识直接初始化到MLP中,无需训练。
Hazy Research最近发现,如果处理得当,transformer可以查询并利用这些知识!
持续学习??? https://t.co/W5CE8Gt84f
相似文章
MLP是Hebbian的:为Transformer构建高效的事实存储MLP
本文从理论上阐述了Transformer中的MLP如何以信息论最优速率存储事实,并提供了一种闭式构造方法,该方法以远少于先前方法的参数实现最优存储容量,并支持模块化事实编辑。
@rohanpaul_ai: @NaceAI的新论文展示了一种可能的方法,可以在不重写语言模型核心参数的情况下添加大量知识…
来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。
@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
@swyx: 同感。一个非常方便的思维框架,用于理解transformer当前擅长学习哪些类型,以及它为何会遇到限制…
文章讨论了一个理解transformer学习优势及其局限性的思维框架,认为相对于能够假设并寻求真相的方法,扩展当前范式可能效率低下,并提及了对对抗性世界模型和强化学习的需求。
@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……
一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。