标签
该论文通过在 Agda 中形式化正字法约束并开发可证明正确的分词修复方案,解决了大型语言模型应用于 Brahmic Scripts 时的分词错误问题,并在 SentencePiece 和 Rust 库中实现了实际应用。
Hugging Face 发布了 tokenizers 库的版本1,支持多语言、多线程扩展,并具有最小的包体积。
本文介绍了一种基于语言学的音素分词器,用于越南语和中文,该分词器将音节分解为声母、韵母和声调成分,从而减小词汇表大小并提高效率。所提出的PhonemicBERT模型在语言理解任务中与现有的分词器和预训练模型相比,展示了具有竞争力或更优的性能。
Hugging Face 发布了 tokenizers v1,这是分词库的重大性能更新,基准测试显示与先前版本相比速度有显著提升。
本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。
这篇研究论文探讨了为什么大型语言模型中的预训练无法跨语言转移知识,指出不相交的词元空间是根本障碍,并提出将语言映射到共享词元空间以改善跨语言泛化能力。
本文测量了梵语与英语和印地语相比的词化成本,发现梵语由于其信息密度高,每命题需要更多词元,但随着词汇表大小的增加,惩罚会降低。
本文进行了一项大规模研究,比较蒸馏的字节模型和令牌模型,发现字节模型在更多计算资源下能达到更高的性能上限,并且比令牌模型更高效利用数据。
本文探讨了使用 Byte-Pair Encoding (BPE) 令牌效率作为比熵更有效的替代方法来检测代码中的密钥,重点关注统计罕见性而非随机性。
BNB Chain在过去一年中领先所有区块链网络,代币化美国国债市值增长,增加了39亿美元。
本文介绍了MEL,一个用于EEG到fMRI翻译的坐标保持型EEG标记化框架,通过显式建模血流动力学延迟和频谱空间动态,解决表示接口不匹配问题,并改善预测性能优于基线方法。
研究发现,神经语言模型在单词级噪声下退化相似,但在字符级噪声下退化不同,分词被确定为关键隐藏变量。它提供了一种无需噪声评估即可预测模型鲁棒性的方法,并建议通过噪声增强训练来提升鲁棒性。
本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。
本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。
本文提出了一种用户表示学习的稠密化定律,量化了数据规模与分词容量之间的关系,并引入了一种自适应分词方法ALGN,以提高十亿级场景的效率。
一条推文推荐了一门斯坦福课程,清晰完整地解释了像ChatGPT和Claude这样的AI模型是如何构建的,涵盖了分词、Transformer架构和训练过程。
一个新的名为FreeToken的开源项目已经发布,包含一篇研究论文和GitHub仓库,测试显示在消费级硬件上,其token处理速度可达约100个token每秒。
CZ倡导在所有区块链上进行代币化以吸引外国直接投资(FDI)。BNB Chain报告称,30天内RWA持有者增加了370%。
SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。