标签
一篇关于现代 NLP 中分词(tokenization)的全面综述,由 32 位 tokenizer 研究者共同编写,涵盖算法、评估、多语言、编码、理论,以及潜在(latent)或视觉(visual)分词等替代方案,还包括受约束生成和 tokenizer 安全等相邻主题。
本文通过从上下两侧对最小词元数进行界定,量化了分词前边界规则的压缩代价,并证明了在英文维基百科上,正则边界会使最优词元数增加28.3%–36.8%;同时表明,以压缩最优化为目标构建的词元字典并不一定能提升语言模型的预测质量。
本文探讨了在聊天模板中使用保留令牌与子词令牌时,如何影响针对 LLM 智能体的提示注入攻击的成功率,并发现保留令牌会显著提高攻击的权限和成功率。
论文表明,大型语言模型中对名称的不平等单词元支持导致跨人口统计学的偏见概念可访问性,并引入了NameTrace来衡量词汇可比性。
本文研究了美式英语如何在大型语言模型中成为默认,通过对美式英语和英式英语变体的对照研究,考察了预训练数据、分词和生成阶段的结构偏差。
该论文通过在 Agda 中形式化正字法约束并开发可证明正确的分词修复方案,解决了大型语言模型应用于 Brahmic Scripts 时的分词错误问题,并在 SentencePiece 和 Rust 库中实现了实际应用。
Hugging Face 发布了 tokenizers 库的版本1,支持多语言、多线程扩展,并具有最小的包体积。
本文介绍了一种基于语言学的音素分词器,用于越南语和中文,该分词器将音节分解为声母、韵母和声调成分,从而减小词汇表大小并提高效率。所提出的PhonemicBERT模型在语言理解任务中与现有的分词器和预训练模型相比,展示了具有竞争力或更优的性能。
Hugging Face 发布了 tokenizers v1,这是分词库的重大性能更新,基准测试显示与先前版本相比速度有显著提升。
本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。
这篇研究论文探讨了为什么大型语言模型中的预训练无法跨语言转移知识,指出不相交的词元空间是根本障碍,并提出将语言映射到共享词元空间以改善跨语言泛化能力。
本文测量了梵语与英语和印地语相比的词化成本,发现梵语由于其信息密度高,每命题需要更多词元,但随着词汇表大小的增加,惩罚会降低。
本文进行了一项大规模研究,比较蒸馏的字节模型和令牌模型,发现字节模型在更多计算资源下能达到更高的性能上限,并且比令牌模型更高效利用数据。
本文探讨了使用 Byte-Pair Encoding (BPE) 令牌效率作为比熵更有效的替代方法来检测代码中的密钥,重点关注统计罕见性而非随机性。
BNB Chain在过去一年中领先所有区块链网络,代币化美国国债市值增长,增加了39亿美元。
本文介绍了MEL,一个用于EEG到fMRI翻译的坐标保持型EEG标记化框架,通过显式建模血流动力学延迟和频谱空间动态,解决表示接口不匹配问题,并改善预测性能优于基线方法。
研究发现,神经语言模型在单词级噪声下退化相似,但在字符级噪声下退化不同,分词被确定为关键隐藏变量。它提供了一种无需噪声评估即可预测模型鲁棒性的方法,并建议通过噪声增强训练来提升鲁棒性。
本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。
本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。