状态预测分离假说

Hugging Face Daily Papers 论文

摘要

本文提出了状态预测分离假说,认为在Transformer中将状态预测与令牌预测分离,能在不同规模上提升语言建模的性能和效率,实验表明该方法持续带来改进。

Transformer使用相同的前向计算流来同时预测下一个令牌和存储对未来令牌预测有用的状态。我们提出了状态预测分离假说:将这两个角色解耦能带来更好的语言建模性能。我们设计了一种使用两个计算流来分离这两个功能的Transformer变体,并在不同规模上进行了预训练实验。实验表明,状态预测分离持续提高了数据和计算效率,改善了验证损失,并在下游任务上平均比标准Transformer高出2--3个百分点。我们还进行了广泛的实证分析,排除了潜在的混杂因素,并展示了我们的设计所导致的梯度上的根本差异。
查看原文
查看缓存全文

缓存时间: 2026/07/02 07:47

论文页面 - 状态预测分离假说

来源:https://huggingface.co/papers/2607.01218

摘要

在Transformer中分离状态预测与Token预测,能够在不同规模下提升语言建模的性能和效率。

Transformers (https://huggingface.co/papers?q=Transformers) 使用相同的前向计算流 (https://huggingface.co/papers?q=forward%20computation%20stream) 同时完成预测下一个token和存储用于未来token预测的有用状态。我们提出了 状态预测分离假说 (https://huggingface.co/papers?q=state-prediction%20separation%20hypothesis):将这两个角色解耦能够带来更优的语言建模性能。我们设计了一种使用两个计算流 (https://huggingface.co/papers?q=computation%20streams) 来分离这两种功能的Transformer变体,并在不同规模上进行了预训练 (https://huggingface.co/papers?q=pretraining) 实验。实验结果表明,状态预测分离始终能在数据和计算效率上带来提升,改善验证损失 (https://huggingface.co/papers?q=validation%20loss),并在下游任务 (https://huggingface.co/papers?q=downstream%20tasks) 上平均超越标准Transformers (https://huggingface.co/papers?q=Transformers) 2-3个百分点。我们还进行了广泛的实证分析,排除了潜在的混杂因素,并展示了我们设计所引入的梯度 (https://huggingface.co/papers?q=gradients) 方面的根本差异。

查看 arXiv 页面 (https://arxiv.org/abs/2607.01218) 查看 PDF (https://arxiv.org/pdf/2607.01218) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.01218)

在你的 Agent 中获取该论文:

hf papers read 2607\.01218

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.01218 以在此页面建立链接。

引用该论文的数据集 0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.01218 以在此页面建立链接。

引用该论文的 Spaces 0

没有 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.01218 以在此页面建立链接。

包含该论文的收藏集 0

没有收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。

相似文章

在词元级别上比较Transformer和混合模型

Lobsters Hottest

本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。

一种新 Transformer 将隐状态传递给下一个 token 而非重新计算(25 分钟阅读)

TLDR AI

论文提出了 LIFT(Latent Information Feedback Transformer),它在生成步骤之间传播深层隐状态,而不是仅依赖已解码的 token,采用 teacher-forced 预训练方式,其状态由现成语言模型的下一个 token 分布生成。在 135M–1B 参数模型上的实验表明,在 token 预算对齐的条件下,LIFT 在语言建模、推理和程序性任务上均优于标准 Transformer,代码和模型均已开源。

Hierarchical Latent Prediction for Language Models

arXiv cs.CL

This paper introduces HiLP, a hierarchical representation training method that adds multi-scale self-predictive learning to transformer pretraining, aiming to reduce compounding error and improve long-horizon reasoning and speculative decoding efficiency.

下一代潜在预测变换器 [R]

Reddit r/MachineLearning

微软研究院提出Next-Latent Prediction (NextLat)方法,一种自监督学习方法,训练变换器预测自身下一个潜在状态,从而形成用于推理和规划的紧凑世界模型,并通过自推测解码实现高达3.3倍的推理加速。