标签
本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。
本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。