状态预测分离假说
摘要
本文提出了状态预测分离假说,认为在Transformer中将状态预测与令牌预测分离,能在不同规模上提升语言建模的性能和效率,实验表明该方法持续带来改进。
查看缓存全文
缓存时间: 2026/07/02 07:47
论文页面 - 状态预测分离假说
来源:https://huggingface.co/papers/2607.01218
摘要
在Transformer中分离状态预测与Token预测,能够在不同规模下提升语言建模的性能和效率。
Transformers (https://huggingface.co/papers?q=Transformers) 使用相同的前向计算流 (https://huggingface.co/papers?q=forward%20computation%20stream) 同时完成预测下一个token和存储用于未来token预测的有用状态。我们提出了 状态预测分离假说 (https://huggingface.co/papers?q=state-prediction%20separation%20hypothesis):将这两个角色解耦能够带来更优的语言建模性能。我们设计了一种使用两个计算流 (https://huggingface.co/papers?q=computation%20streams) 来分离这两种功能的Transformer变体,并在不同规模上进行了预训练 (https://huggingface.co/papers?q=pretraining) 实验。实验结果表明,状态预测分离始终能在数据和计算效率上带来提升,改善验证损失 (https://huggingface.co/papers?q=validation%20loss),并在下游任务 (https://huggingface.co/papers?q=downstream%20tasks) 上平均超越标准Transformers (https://huggingface.co/papers?q=Transformers) 2-3个百分点。我们还进行了广泛的实证分析,排除了潜在的混杂因素,并展示了我们设计所引入的梯度 (https://huggingface.co/papers?q=gradients) 方面的根本差异。
查看 arXiv 页面 (https://arxiv.org/abs/2607.01218) 查看 PDF (https://arxiv.org/pdf/2607.01218) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.01218)
在你的 Agent 中获取该论文:
hf papers read 2607\.01218
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.01218 以在此页面建立链接。
引用该论文的数据集 0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.01218 以在此页面建立链接。
引用该论文的 Spaces 0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.01218 以在此页面建立链接。
包含该论文的收藏集 0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
在词元级别上比较Transformer和混合模型
本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。
一种新 Transformer 将隐状态传递给下一个 token 而非重新计算(25 分钟阅读)
论文提出了 LIFT(Latent Information Feedback Transformer),它在生成步骤之间传播深层隐状态,而不是仅依赖已解码的 token,采用 teacher-forced 预训练方式,其状态由现成语言模型的下一个 token 分布生成。在 135M–1B 参数模型上的实验表明,在 token 预算对齐的条件下,LIFT 在语言建模、推理和程序性任务上均优于标准 Transformer,代码和模型均已开源。
Hierarchical Latent Prediction for Language Models
This paper introduces HiLP, a hierarchical representation training method that adds multi-scale self-predictive learning to transformer pretraining, aiming to reduce compounding error and improve long-horizon reasoning and speculative decoding efficiency.
@rohanpaul_ai: 新微软论文认为,Transformer在学会紧凑内部状态时泛化更好,而不仅仅是预测下一个token……
微软的NextLat论文提出了一种自监督训练方法,让Transformer预测其下一个隐藏状态而非仅仅下一个token,从而形成更紧凑的世界模型,更好地进行规划和推理,并且生成速度提升高达3.3倍。
下一代潜在预测变换器 [R]
微软研究院提出Next-Latent Prediction (NextLat)方法,一种自监督学习方法,训练变换器预测自身下一个潜在状态,从而形成用于推理和规划的紧凑世界模型,并通过自推测解码实现高达3.3倍的推理加速。