基于层级语言模型的动态多字节预测

Hugging Face Daily Papers 论文

摘要

本文介绍了多字节预测,通过并行生成多个字节来加速字节级语言模型的推理,同时对性能的影响最小。

字节级层级语言模型(LM)最近已成为使用子词分词的流行模型的稳健替代方案。然而,一次生成一个字节仍然是推理速度的瓶颈。为了解决这个问题,我们引入了多字节预测(MBP),它并行生成多个字节,从而加速推理,同时对性能的影响最小且无需额外参数。MBP基于流行的多令牌预测(MTP)范式,并进行了两项关键创新。首先,我们引入了一个可变长度的预测窗口,与层级语言模型的潜在令牌或段对齐。其次,我们实现了一种新颖的注意力掩码方案,使得能够并行预测字节而不违反因果性。我们证明,多字节预测在多个生成任务(如指令跟随、问答、摘要和机器翻译)中实现了帕累托最优的权衡,达到了性能和推理吞吐量之间的最佳平衡。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:59

论文页面 - 基于分层语言模型的动态多字节预测

来源:https://huggingface.co/papers/2608.15454

摘要

多字节预测通过变长窗口和因果注意力掩码生成并行字节,加速了字节级分层语言模型的推理速度,以极小的质量损失提升了推理效率。

字节级分层语言模型(https://huggingface.co/papers?q=Byte-level%20hierarchical%20language%20models)已成为采用子词分词模型的流行替代方案。然而,逐字节生成仍是推理速度的瓶颈。为此,我们引入了多字节预测(https://huggingface.co/papers?q=multi-byte%20prediction),该方法通过并行生成多个字节,在几乎不影响性能且无需增加参数的情况下加速推理。多字节预测建立在流行的多令牌预测(https://huggingface.co/papers?q=multi-token%20prediction)范式之上,包含两项关键创新:首先,我们引入了与分层语言模型的潜在令牌(或分段)对齐的变长预测窗口(https://huggingface.co/papers?q=variable-length%20prediction%20window);其次,我们设计了一种新型注意力掩码(https://huggingface.co/papers?q=attention-masking)方案,可在不违反因果性的前提下实现并行字节预测。研究表明,多字节预测(https://huggingface.co/papers?q=multi-byte%20prediction)在多项生成任务(指令遵循、问答、摘要、机器翻译)中实现了帕累托最优权衡,在性能与推理吞吐量(https://huggingface.co/papers?q=inference%20throughput)间达到最佳平衡。

查看arXiv页面 (https://arxiv.org/abs/2608.15454)查看PDF (https://arxiv.org/pdf/2608.15454)GitHub0 (https://github.com/skai-research/lca-multibyte)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15454)

在您的智能体中获取此论文:

hf papers read 2608\.15454

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.15454以从本页建立链接\。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.15454以从本页建立链接\。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.15454以从本页建立链接\。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页建立链接\。

相似文章

Hierarchical Latent Prediction for Language Models

arXiv cs.CL

This paper introduces HiLP, a hierarchical representation training method that adds multi-scale self-predictive learning to transformer pretraining, aiming to reduce compounding error and improve long-horizon reasoning and speculative decoding efficiency.

快速字节潜在Transformer

Hugging Face Daily Papers

本文介绍了用于字节级语言模型的BLT扩散(BLT Diffusion)和投机解码技术,在保持生成质量的同时,显著降低了生成延迟和内存带宽成本。

训练具有部分双向性的混合块扩散语言模型

arXiv cs.LG

本文提出了一种用于块扩散语言模型的混合Mamba-注意力架构,该架构将反向Mamba扫描限制在活跃去噪块内,从而实现了块间的精确缓存,并在长上下文生成中达到了高吞吐量。

多块扩散语言模型

Hugging Face Daily Papers

本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。