标签
本文提出了一种控制神经网络中循环动态的方法,以实现可靠的测试时深度,分析了稳定、边际或漂移等动态机制,以提高算法任务如数独和进位传播的性能。
本文介绍了Bifocal Attention,它将位置编码解耦为几何(标准RoPE)和频谱(Learnable Harmonic Operators)两种模态,以解决固定RoPE的'Spectral Rigidity'问题,从而改善超出训练窗口的算法泛化能力。
本文介绍了RecurrReason,这是一个难度可控的基准测试,包含四个符号逻辑谜题,用于评估序列模型中的多步推理能力。在T5和GPT-2上的微调实验表明,架构比规模更能决定成功,且预训练迁移依赖于局部转移结构。
本文介绍了PyLang,一种在所有预训练语料库中都不存在的编程语言,并表明在其上微调的大语言模型可以学习语法但无法迁移算法推理,导致出现“实现忠实度差距”——模型理解算法但无法用不熟悉的语言表达它们。