标签
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
The Cognitive Categorical Transformer (CCT) 使用范畴理论组件增强GPT-2 Small,在匹配训练条件下在WikiText-103上实现了12%的相对困惑度降低,其中单纯消息传递贡献了84%的改进。