MultiHashFormer:基于哈希的生成式语言模型
摘要
MultiHashFormer是一种基于哈希的生成式语言模型,它通过将每个词元表示为独特的哈希签名,实现了参数高效的自回归。在1亿、10亿和30亿参数规模上,该模型均优于标准Transformer语言模型,并且能够在参数不变的情况下支持多语言词汇扩展。
查看缓存全文
缓存时间: 2026/06/29 05:25
# MultiHashFormer:基于哈希的生成式语言模型 来源:https://arxiv.org/abs/2606.28057 查看 PDF(https://arxiv.org/pdf/2606.28057) > **摘要**:语言模型使用随词汇量线性扩展的嵌入矩阵来表示标记。为了限制参数规模,先前的工作提出在仅编码器模型中将许多标记哈希到单个向量中。虽然这提供了参数效率,但多对一碰撞问题阻碍了其在因果语言模型中的应用。在本文中,我们提出了 MultiHashFormer,一种允许基于哈希的自回归的新框架。每个标记被表示为唯一的哈希签名,即由多个独立哈希函数生成的短离散哈希 ID 序列。哈希编码器将此签名压缩为单个潜在向量,供 Transformer 解码器处理。然后,哈希解码器生成下一个标记的哈希签名,再将其映射回文本。我们在 1 亿、10 亿和 30 亿参数规模下评估了我们的方法,结果表明 MultiHashFormer 在多个基准测试中始终优于标准 Transformer 语言模型。此外,我们展示了模型能够以恒定的参数空间处理多语言词汇扩展,而无需任何修改。 ## 提交历史 来自:薛惠尹 \[查看电子邮件 (https://arxiv.org/show-email/3c52616c/2606.28057)\] **\[v1\]** 2026 年 6 月 26 日星期五 13:03:29 UTC(4,031 KB)
相似文章
多头注意力残差
介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。
BitLM:利用位级连续扩散解锁多 Token 语言生成
本文介绍了 BitLM,一种利用位级连续扩散并行生成多个 Token 的语言模型,旨在克服传统自回归生成的顺序瓶颈,同时保留因果结构。
基于层级语言模型的动态多字节预测
本文介绍了多字节预测,通过并行生成多个字节来加速字节级语言模型的推理,同时对性能的影响最小。
多块扩散语言模型
本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。
多头循环记忆代理
本文指出记忆保留是长上下文场景下循环记忆代理的瓶颈,并提出多头循环记忆(MHM),这是一种无需训练的框架,通过“先选择后更新”策略将记忆划分为独立的头。轻量级实例化版本 MHM-LRU 显著提升了 100K 至 1M token 范围内的记忆保留率和端到端准确率,在 896K token 的 RULER-HQA 上,将记忆保留率从低于 30% 提升至 73.96%。