@andrew_n_carr: 事实证明,你可以在无需训练的情况下,将知识初始化到MLP中。Hazy Research刚刚表明,...

X AI KOLs Timeline 论文

摘要

Hazy Research 表明,一个 MLP 可以在无需训练的情况下,通过嵌入知识进行初始化,然后一个 transformer 可以查询并使用该知识,这暗示了持续学习的能力。

事实证明,你可以在无需训练的情况下,将知识初始化到MLP中。 Hazy Research刚刚表明,如果正确执行,transformer可以查询并使用该知识! 持续学习??? https://t.co/W5CE8Gt84f
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:20

原来你可以将知识直接初始化到MLP中,无需训练。

Hazy Research最近发现,如果处理得当,transformer可以查询并利用这些知识!

持续学习??? https://t.co/W5CE8Gt84f

相似文章

@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……

X AI KOLs Timeline

一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。