tokenization

标签

Cards List
#tokenization

生命周期最优分词:词汇表大小作为部署场景相关的基础设施参数

arXiv cs.LG · 昨天 缓存

本文认为最优分词器词汇表大小并非固定不变,而是取决于部署场景,例如批大小和推理量。通过roofline分析以及在A10G和A100 GPU上的实验,本文展示了在端侧部署和数据中心服务之间,生命周期最优词汇量可变化多达16倍,且对质量影响极小。

0 人收藏 0 人点赞
#tokenization

难怪 Qwen 和 Gemma 差异这么大

Reddit r/LocalLLaMA · 5天前

一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。

0 人收藏 0 人点赞
#tokenization

面向令牌化电子健康记录的联邦生成式事件模型

arXiv cs.LG · 2026-08-05 缓存

这篇arXiv论文评估了在来自三个医疗系统的ICU EHR数据上,对令牌化生成式事件模型(GEMs)进行联邦训练的效果,结果表明联邦学习能够保留集中式训练的大部分性能,并且与传统监督模型相比,提高了跨站点的可迁移性。

0 人收藏 0 人点赞
#tokenization

Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding

arXiv cs.CL · 2026-08-04 缓存

This paper proposes Pruned BPE, a post-training method that prunes low-exposure tokens from a BPE vocabulary and reallocates slots to better-exposed candidates, reducing encoded length without increasing model-visible vocabulary size. Experiments on English and Chinese corpora show approximately 0.27–0.36% encoded length reduction over standard BPE.

0 人收藏 0 人点赞
#tokenization

@omarsar0: TokTier makes tokenization stateful for agentic serving. Across 153,951 real agent calls with a 94.1% prompt-cache hit …

X AI KOLs Following · 2026-08-03 缓存

TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.

0 人收藏 0 人点赞
#tokenization

赋能跨域序列推荐:混合分词与串并化解码

arXiv cs.AI · 2026-08-03 缓存

本文提出GenCDSR,一种用于跨域序列推荐的生成式框架,采用混合分词与串并化解码,在准确率上优于现有最优基线,并将推理延迟显著降低。

0 人收藏 0 人点赞
#tokenization

语言模型对不同语言中的非规范分词并非同样鲁棒

arXiv cs.CL · 2026-07-30 缓存

本文研究了语言模型在27种语言中是否对替代(非规范)分词保持鲁棒性,发现英语中观察到的不变性并不具有普适性,且分词碎片化程度更高的语言表现出更高的敏感性。作者证明,使用多分词数据的LoRA微调可以有效缓解这种敏感性。

0 人收藏 0 人点赞
#tokenization

贪心最长匹配分词联合优化

arXiv cs.CL · 2026-07-28 缓存

本文提出JOLT,一种整数规划方法,用于优化基于从左到右贪心最长匹配解码(WordPiece)的子词分词。JOLT实现了近乎最优的压缩,缩小了BPE与理论下界之间的大部分差距,使token数量相比BPE最多减少0.78%。

0 人收藏 0 人点赞
#tokenization

BHARATI:面向古典印度语言的形态感知分词器与子词丰富度分析

arXiv cs.CL · 2026-07-28 缓存

本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。

0 人收藏 0 人点赞
#tokenization

巴西农民将奶牛代币化以获得贷款,绕过银行限制

Hacker News Top · 2026-07-25 缓存

巴西农民在B3证券交易所将10头奶牛代币化,筹集了近2万美元的牲畜担保信贷,使用AI智能追踪项圈防止欺诈并实现动产抵押。

0 人收藏 0 人点赞
#tokenization

GigaToken:语言模型分词速度提升约1000倍

Hacker News Top · 2026-07-22 缓存

GigaToken 是一个超快速的分词器库,声称比 HuggingFace 分词器快达 1000 倍,支持大多数常见的大语言模型分词器,并提供即插即用的兼容性。

0 人收藏 0 人点赞
#tokenization

@maximelabonne: 如何为模型添加新语言?高效的分词在此中扮演关键角色。在这篇新博文中,我们讨论…

X AI KOLs Following · 2026-07-21 缓存

Liquid AI 分享了原地升级预训练模型分词器的秘诀,将 LFM2.5 的分词器从 65K 扩展到 128K,以提高对泰语、越南语和印地语等语言的效率,结果使得令牌数量减少多达4倍,生成速度提升2.2-3.7倍。

0 人收藏 0 人点赞
#tokenization

跨语言同形词的标记化

arXiv cs.CL · 2026-07-21 缓存

本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。

0 人收藏 0 人点赞
#tokenization

离散扩散模型:从分词到生成的统一框架

arXiv cs.LG · 2026-07-16 缓存

本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。

0 人收藏 0 人点赞
#tokenization

Real Up戛纳峰会发布“Anvita”,助力代理到代理经济

Reddit r/ArtificialInteligence · 2026-07-11 缓存

蚂蚁数字科技在Real Up戛纳峰会上推出了新的Web3+AI品牌Anvita,旨在构建代理到代理(A2A)数字经济的基础设施,其中包含用于自主代理协作的Anvita Flow和用于代币化即服务的Anvita TaaS。

0 人收藏 0 人点赞
#tokenization

让我们为APL构建一个简单的解释器

Lobsters Hottest · 2026-07-10 缓存

这篇博文开启了一个系列,介绍如何在Python中构建APL解释器,涵盖对包含数字、函数和运算符的基本APL表达式进行分词和解析。

0 人收藏 0 人点赞
#tokenization

在哪里切割,切割多深:化学SMILES中的BPE与Unigram-LM

arXiv cs.CL · 2026-07-08 缓存

本文系统比较了化学SMILES字符串的BPE和Unigram-LM分词方法,发现它们产生了几乎不相交的词汇表,并且在分割粒度上存在显著差异。结果表明,子词算法的选择是一个关键的建模决策,而不是一个免费的默认选项。

0 人收藏 0 人点赞
#tokenization

说话人解耦的分块回归用于音节标记化

Hugging Face Daily Papers · 2026-07-05 缓存

本文提出了一种说话人解耦的音节标记器,通过对扰动学生表示向干净教师目标进行回归,实现了最先进的音节边界检测,并在语音语言模型理解上相对于SpiRit-LM取得了7%的相对提升。

0 人收藏 0 人点赞
#tokenization

@VictoriaLinML: The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online. I d…

X AI KOLs Timeline · 2026-07-03 缓存

Victoria Lin's Stanford CS25 lecture discusses the paradigm shift from language models to native multimodal intelligence, covering tokenization approaches and comparing models like Chameleon and Transfusion.

0 人收藏 0 人点赞
#tokenization

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers · 2026-06-29 缓存

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈