tokenization

标签

Cards List
#tokenization

面向 Brahmic Scripts 的类型驱动分词

arXiv cs.CL ↗ · 4天前 缓存

该论文通过在 Agda 中形式化正字法约束并开发可证明正确的分词修复方案,解决了大型语言模型应用于 Brahmic Scripts 时的分词错误问题,并在 SentencePiece 和 Rust 库中实现了实际应用。

0 人收藏 0 人点赞
#tokenization

tokenizers v1 (Rust版)

Reddit r/LocalLLaMA ↗ · 4天前

Hugging Face 发布了 tokenizers 库的版本1,支持多语言、多线程扩展,并具有最小的包体积。

0 人收藏 0 人点赞
#tokenization

超越原子标记:音节分解在语言模型预训练中的应用

arXiv cs.CL ↗ · 5天前 缓存

本文介绍了一种基于语言学的音素分词器,用于越南语和中文,该分词器将音节分解为声母、韵母和声调成分,从而减小词汇表大小并提高效率。所提出的PhonemicBERT模型在语言理解任务中与现有的分词器和预训练模型相比,展示了具有竞争力或更优的性能。

0 人收藏 0 人点赞
#tokenization

tokenizers v1:编码、解码与扩展性能实测

Hugging Face Blog ↗ · 5天前 缓存

Hugging Face 发布了 tokenizers v1,这是分词库的重大性能更新,基准测试显示与先前版本相比速度有显著提升。

0 人收藏 0 人点赞
#tokenization

从零开始的世界模型 2:模型训练与梦境生成 [P]

Reddit r/MachineLearning ↗ · 6天前 缓存

本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。

0 人收藏 0 人点赞
#tokenization

为何预训练无法共享跨语言知识

arXiv cs.CL ↗ · 2026-09-18 缓存

这篇研究论文探讨了为什么大型语言模型中的预训练无法跨语言转移知识,指出不相交的词元空间是根本障碍,并提出将语言映射到共享词元空间以改善跨语言泛化能力。

0 人收藏 0 人点赞
#tokenization

词少但词元不少:衡量梵语每命题的词化代价

arXiv cs.CL ↗ · 2026-09-14 缓存

本文测量了梵语与英语和印地语相比的词化成本,发现梵语由于其信息密度高,每命题需要更多词元,但随着词汇表大小的增加,惩罚会降低。

0 人收藏 0 人点赞
#tokenization

打破令牌天花板:蒸馏更小、更强的字节模型

arXiv cs.CL ↗ · 2026-09-14 缓存

本文进行了一项大规模研究,比较蒸馏的字节模型和令牌模型,发现字节模型在更多计算资源下能达到更高的性能上限,并且比令牌模型更高效利用数据。

0 人收藏 0 人点赞
#tokenization

使用令牌效率进行密钥扫描:罕见而非随机

Lobsters Hottest ↗ · 2026-09-12 缓存

本文探讨了使用 Byte-Pair Encoding (BPE) 令牌效率作为比熵更有效的替代方法来检测代码中的密钥,重点关注统计罕见性而非随机性。

0 人收藏 0 人点赞
#tokenization

@TCryptochicks: BNB Chain在过去一年中领先所有链,代币化美国国债市值增长,增加了令人印象深刻的39亿美元…

X AI KOLs Following ↗ · 2026-09-10 缓存

BNB Chain在过去一年中领先所有区块链网络,代币化美国国债市值增长,增加了39亿美元。

0 人收藏 0 人点赞
#tokenization

MEL:用于fMRI翻译的坐标保持型EEG标记化

arXiv cs.LG ↗ · 2026-09-01 缓存

本文介绍了MEL,一个用于EEG到fMRI翻译的坐标保持型EEG标记化框架,通过显式建模血流动力学延迟和频谱空间动态,解决表示接口不匹配问题,并改善预测性能优于基线方法。

0 人收藏 0 人点赞
#tokenization

噪声响应的普遍性何时出现?分词作为语言模型中的隐藏变量

arXiv cs.CL ↗ · 2026-08-28 缓存

研究发现,神经语言模型在单词级噪声下退化相似,但在字符级噪声下退化不同,分词被确定为关键隐藏变量。它提供了一种无需噪声评估即可预测模型鲁棒性的方法,并建议通过噪声增强训练来提升鲁棒性。

0 人收藏 0 人点赞
#tokenization

压缩中的迷失:抽取式提示压缩器的跨语言可控审计

arXiv cs.CL ↗ · 2026-08-28 缓存

本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。

0 人收藏 0 人点赞
#tokenization

苹果比苹果?迈向可比的跨语言语言模型评估

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。

0 人收藏 0 人点赞
#tokenization

方言税:方言偏见在语言建模流程中的持续存在

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究了方言偏见如何在整个语言建模流程中持续存在和累积,从分词到推理,表明差异在每一步都被编码。

0 人收藏 0 人点赞
#tokenization

迈向十亿级容量用户表示学习的稠密化定律

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

本文提出了一种用户表示学习的稠密化定律,量化了数据规模与分词容量之间的关系,并引入了一种自适应分词方法ALGN,以提高十亿级场景的效率。

0 人收藏 0 人点赞
#tokenization

@dkare1009: 今晚别看Netflix了。观看这2小时34分钟的斯坦福课程。这是最清晰、最完整、最坦率的解释…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

一条推文推荐了一门斯坦福课程,清晰完整地解释了像ChatGPT和Claude这样的AI模型是如何构建的,涵盖了分词、Transformer架构和训练过程。

0 人收藏 0 人点赞
#tokenization

Freetokens项目令人印象深刻

Reddit r/LocalLLaMA ↗ · 2026-08-22

一个新的名为FreeToken的开源项目已经发布,包含一篇研究论文和GitHub仓库,测试显示在消费级硬件上,其token处理速度可达约100个token每秒。

0 人收藏 0 人点赞
#tokenization

@cz_binance:让我们将一切代币化。代币化是各国“筹资”或吸引外国直接投资(FDI)的最佳方式之一…

X AI KOLs Following ↗ · 2026-08-21 缓存

CZ倡导在所有区块链上进行代币化以吸引外国直接投资(FDI)。BNB Chain报告称,30天内RWA持有者增加了370%。

0 人收藏 0 人点赞
#tokenization

SuTRA:结构统一的词元化与根词意识

arXiv cs.CL ↗ · 2026-08-20 缓存

SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈