基于层级语言模型的动态多字节预测
摘要
本文介绍了多字节预测,通过并行生成多个字节来加速字节级语言模型的推理,同时对性能的影响最小。
查看缓存全文
缓存时间: 2026/08/19 03:59
论文页面 - 基于分层语言模型的动态多字节预测
来源:https://huggingface.co/papers/2608.15454
摘要
多字节预测通过变长窗口和因果注意力掩码生成并行字节,加速了字节级分层语言模型的推理速度,以极小的质量损失提升了推理效率。
字节级分层语言模型(https://huggingface.co/papers?q=Byte-level%20hierarchical%20language%20models)已成为采用子词分词模型的流行替代方案。然而,逐字节生成仍是推理速度的瓶颈。为此,我们引入了多字节预测(https://huggingface.co/papers?q=multi-byte%20prediction),该方法通过并行生成多个字节,在几乎不影响性能且无需增加参数的情况下加速推理。多字节预测建立在流行的多令牌预测(https://huggingface.co/papers?q=multi-token%20prediction)范式之上,包含两项关键创新:首先,我们引入了与分层语言模型的潜在令牌(或分段)对齐的变长预测窗口(https://huggingface.co/papers?q=variable-length%20prediction%20window);其次,我们设计了一种新型注意力掩码(https://huggingface.co/papers?q=attention-masking)方案,可在不违反因果性的前提下实现并行字节预测。研究表明,多字节预测(https://huggingface.co/papers?q=multi-byte%20prediction)在多项生成任务(指令遵循、问答、摘要、机器翻译)中实现了帕累托最优权衡,在性能与推理吞吐量(https://huggingface.co/papers?q=inference%20throughput)间达到最佳平衡。
查看arXiv页面 (https://arxiv.org/abs/2608.15454)查看PDF (https://arxiv.org/pdf/2608.15454)GitHub0 (https://github.com/skai-research/lca-multibyte)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15454)
在您的智能体中获取此论文:
hf papers read 2608\.15454
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.15454以从本页建立链接\。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.15454以从本页建立链接\。
引用此论文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.15454以从本页建立链接\。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页建立链接\。
相似文章
Hierarchical Latent Prediction for Language Models
This paper introduces HiLP, a hierarchical representation training method that adds multi-scale self-predictive learning to transformer pretraining, aiming to reduce compounding error and improve long-horizon reasoning and speculative decoding efficiency.
快速字节潜在Transformer
本文介绍了用于字节级语言模型的BLT扩散(BLT Diffusion)和投机解码技术,在保持生成质量的同时,显著降低了生成延迟和内存带宽成本。
基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模
本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。
训练具有部分双向性的混合块扩散语言模型
本文提出了一种用于块扩散语言模型的混合Mamba-注意力架构,该架构将反向Mamba扫描限制在活跃去噪块内,从而实现了块间的精确缓存,并在长上下文生成中达到了高吞吐量。
多块扩散语言模型
本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。