tokenization

标签

Cards List
#tokenization

迈向十亿级容量用户表示学习的稠密化定律

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

本文提出了一种用户表示学习的稠密化定律,量化了数据规模与分词容量之间的关系,并引入了一种自适应分词方法ALGN,以提高十亿级场景的效率。

0 人收藏 0 人点赞
#tokenization

@dkare1009: 今晚别看Netflix了。观看这2小时34分钟的斯坦福课程。这是最清晰、最完整、最坦率的解释…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

一条推文推荐了一门斯坦福课程,清晰完整地解释了像ChatGPT和Claude这样的AI模型是如何构建的,涵盖了分词、Transformer架构和训练过程。

0 人收藏 0 人点赞
#tokenization

Freetokens项目令人印象深刻

Reddit r/LocalLLaMA ↗ · 2026-08-22

一个新的名为FreeToken的开源项目已经发布,包含一篇研究论文和GitHub仓库,测试显示在消费级硬件上,其token处理速度可达约100个token每秒。

0 人收藏 0 人点赞
#tokenization

@cz_binance:让我们将一切代币化。代币化是各国“筹资”或吸引外国直接投资(FDI)的最佳方式之一…

X AI KOLs Following ↗ · 2026-08-21 缓存

CZ倡导在所有区块链上进行代币化以吸引外国直接投资(FDI)。BNB Chain报告称,30天内RWA持有者增加了370%。

0 人收藏 0 人点赞
#tokenization

SuTRA:结构统一的词元化与根词意识

arXiv cs.CL ↗ · 2026-08-20 缓存

SuTRA是一种形态感知的词元化算法,它保留了印度语言中akshara的不可分割性,减少了形态破碎现象,并在机器翻译指标上相较于标准BPE方法有所提升。

0 人收藏 0 人点赞
#tokenization

当分词与语言建模联合优化时,会学习到哪些词元?

arXiv cs.CL ↗ · 2026-08-19 缓存

本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。

0 人收藏 0 人点赞
#tokenization

字形非字母,记号非单词,空格非空格:Voynichese单元之否定

arXiv cs.CL ↗ · 2026-08-19 缓存

本文挑战了关于Voynich手稿语言单元的标准假设,通过定量分析表明,字形、记号和空格并不如普遍认为的那样对应于字母、单词和单词间隔。

0 人收藏 0 人点赞
#tokenization

自动补全分词器的试点研究

arXiv cs.CL ↗ · 2026-08-18 缓存

本文提出了一种针对字节级分词的压缩方案,利用自动补全模型从输入序列中移除可预测的字节,在保持多语言机器翻译性能的同时缩短序列长度。

0 人收藏 0 人点赞
#tokenization

ReconSpan:重构引导的自适应潜在分词

arXiv cs.CL ↗ · 2026-08-14 缓存

ReconSpan 引入了一种自适应潜在分词方法,利用后向解码器将文本划分为可重构的块,从而实现可变长度的潜在标记以及训练后对粒度的控制。

0 人收藏 0 人点赞
#tokenization

生命周期最优分词:词汇表大小作为部署场景相关的基础设施参数

arXiv cs.LG ↗ · 2026-08-13 缓存

本文认为最优分词器词汇表大小并非固定不变,而是取决于部署场景,例如批大小和推理量。通过roofline分析以及在A10G和A100 GPU上的实验,本文展示了在端侧部署和数据中心服务之间,生命周期最优词汇量可变化多达16倍,且对质量影响极小。

0 人收藏 0 人点赞
#tokenization

难怪 Qwen 和 Gemma 差异这么大

Reddit r/LocalLLaMA ↗ · 2026-08-09

一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。

0 人收藏 0 人点赞
#tokenization

面向令牌化电子健康记录的联邦生成式事件模型

arXiv cs.LG ↗ · 2026-08-05 缓存

这篇arXiv论文评估了在来自三个医疗系统的ICU EHR数据上,对令牌化生成式事件模型(GEMs)进行联邦训练的效果,结果表明联邦学习能够保留集中式训练的大部分性能,并且与传统监督模型相比,提高了跨站点的可迁移性。

0 人收藏 0 人点赞
#tokenization

Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding

arXiv cs.CL ↗ · 2026-08-04 缓存

This paper proposes Pruned BPE, a post-training method that prunes low-exposure tokens from a BPE vocabulary and reallocates slots to better-exposed candidates, reducing encoded length without increasing model-visible vocabulary size. Experiments on English and Chinese corpora show approximately 0.27–0.36% encoded length reduction over standard BPE.

0 人收藏 0 人点赞
#tokenization

@omarsar0: TokTier makes tokenization stateful for agentic serving. Across 153,951 real agent calls with a 94.1% prompt-cache hit …

X AI KOLs Following ↗ · 2026-08-03 缓存

TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.

0 人收藏 0 人点赞
#tokenization

赋能跨域序列推荐:混合分词与串并化解码

arXiv cs.AI ↗ · 2026-08-03 缓存

本文提出GenCDSR,一种用于跨域序列推荐的生成式框架,采用混合分词与串并化解码,在准确率上优于现有最优基线,并将推理延迟显著降低。

0 人收藏 0 人点赞
#tokenization

语言模型对不同语言中的非规范分词并非同样鲁棒

arXiv cs.CL ↗ · 2026-07-30 缓存

本文研究了语言模型在27种语言中是否对替代(非规范)分词保持鲁棒性,发现英语中观察到的不变性并不具有普适性,且分词碎片化程度更高的语言表现出更高的敏感性。作者证明,使用多分词数据的LoRA微调可以有效缓解这种敏感性。

0 人收藏 0 人点赞
#tokenization

贪心最长匹配分词联合优化

arXiv cs.CL ↗ · 2026-07-28 缓存

本文提出JOLT,一种整数规划方法,用于优化基于从左到右贪心最长匹配解码(WordPiece)的子词分词。JOLT实现了近乎最优的压缩,缩小了BPE与理论下界之间的大部分差距,使token数量相比BPE最多减少0.78%。

0 人收藏 0 人点赞
#tokenization

BHARATI:面向古典印度语言的形态感知分词器与子词丰富度分析

arXiv cs.CL ↗ · 2026-07-28 缓存

本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。

0 人收藏 0 人点赞
#tokenization

巴西农民将奶牛代币化以获得贷款,绕过银行限制

Hacker News Top ↗ · 2026-07-25 缓存

巴西农民在B3证券交易所将10头奶牛代币化,筹集了近2万美元的牲畜担保信贷,使用AI智能追踪项圈防止欺诈并实现动产抵押。

0 人收藏 0 人点赞
#tokenization

GigaToken:语言模型分词速度提升约1000倍

Hacker News Top ↗ · 2026-07-22 缓存

GigaToken 是一个超快速的分词器库,声称比 HuggingFace 分词器快达 1000 倍,支持大多数常见的大语言模型分词器,并提供即插即用的兼容性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈