tokenization

标签

Cards List
#tokenization

语言模型对不同语言中的非规范分词并非同样鲁棒

arXiv cs.CL ↗ · 2026-07-30 缓存

本文研究了语言模型在27种语言中是否对替代(非规范)分词保持鲁棒性,发现英语中观察到的不变性并不具有普适性,且分词碎片化程度更高的语言表现出更高的敏感性。作者证明,使用多分词数据的LoRA微调可以有效缓解这种敏感性。

0 人收藏 0 人点赞
#tokenization

贪心最长匹配分词联合优化

arXiv cs.CL ↗ · 2026-07-28 缓存

本文提出JOLT,一种整数规划方法,用于优化基于从左到右贪心最长匹配解码(WordPiece)的子词分词。JOLT实现了近乎最优的压缩,缩小了BPE与理论下界之间的大部分差距,使token数量相比BPE最多减少0.78%。

0 人收藏 0 人点赞
#tokenization

BHARATI:面向古典印度语言的形态感知分词器与子词丰富度分析

arXiv cs.CL ↗ · 2026-07-28 缓存

本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。

0 人收藏 0 人点赞
#tokenization

巴西农民将奶牛代币化以获得贷款,绕过银行限制

Hacker News Top ↗ · 2026-07-25 缓存

巴西农民在B3证券交易所将10头奶牛代币化,筹集了近2万美元的牲畜担保信贷,使用AI智能追踪项圈防止欺诈并实现动产抵押。

0 人收藏 0 人点赞
#tokenization

GigaToken:语言模型分词速度提升约1000倍

Hacker News Top ↗ · 2026-07-22 缓存

GigaToken 是一个超快速的分词器库,声称比 HuggingFace 分词器快达 1000 倍,支持大多数常见的大语言模型分词器,并提供即插即用的兼容性。

0 人收藏 0 人点赞
#tokenization

@maximelabonne: 如何为模型添加新语言?高效的分词在此中扮演关键角色。在这篇新博文中,我们讨论…

X AI KOLs Following ↗ · 2026-07-21 缓存

Liquid AI 分享了原地升级预训练模型分词器的秘诀,将 LFM2.5 的分词器从 65K 扩展到 128K,以提高对泰语、越南语和印地语等语言的效率,结果使得令牌数量减少多达4倍,生成速度提升2.2-3.7倍。

0 人收藏 0 人点赞
#tokenization

跨语言同形词的标记化

arXiv cs.CL ↗ · 2026-07-21 缓存

本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。

0 人收藏 0 人点赞
#tokenization

离散扩散模型:从分词到生成的统一框架

arXiv cs.LG ↗ · 2026-07-16 缓存

本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。

0 人收藏 0 人点赞
#tokenization

Real Up戛纳峰会发布“Anvita”,助力代理到代理经济

Reddit r/ArtificialInteligence ↗ · 2026-07-11 缓存

蚂蚁数字科技在Real Up戛纳峰会上推出了新的Web3+AI品牌Anvita,旨在构建代理到代理(A2A)数字经济的基础设施,其中包含用于自主代理协作的Anvita Flow和用于代币化即服务的Anvita TaaS。

0 人收藏 0 人点赞
#tokenization

让我们为APL构建一个简单的解释器

Lobsters Hottest ↗ · 2026-07-10 缓存

这篇博文开启了一个系列,介绍如何在Python中构建APL解释器,涵盖对包含数字、函数和运算符的基本APL表达式进行分词和解析。

0 人收藏 0 人点赞
#tokenization

在哪里切割,切割多深:化学SMILES中的BPE与Unigram-LM

arXiv cs.CL ↗ · 2026-07-08 缓存

本文系统比较了化学SMILES字符串的BPE和Unigram-LM分词方法,发现它们产生了几乎不相交的词汇表,并且在分割粒度上存在显著差异。结果表明,子词算法的选择是一个关键的建模决策,而不是一个免费的默认选项。

0 人收藏 0 人点赞
#tokenization

说话人解耦的分块回归用于音节标记化

Hugging Face Daily Papers ↗ · 2026-07-05 缓存

本文提出了一种说话人解耦的音节标记器,通过对扰动学生表示向干净教师目标进行回归,实现了最先进的音节边界检测,并在语音语言模型理解上相对于SpiRit-LM取得了7%的相对提升。

0 人收藏 0 人点赞
#tokenization

@VictoriaLinML: The video of my Stanford CS25 guest lecture, From Language Models to Native Multimodal Intelligence, is now online. I d…

X AI KOLs Timeline ↗ · 2026-07-03 缓存

Victoria Lin's Stanford CS25 lecture discusses the paradigm shift from language models to native multimodal intelligence, covering tokenization approaches and comparing models like Chameleon and Transfusion.

0 人收藏 0 人点赞
#tokenization

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。

0 人收藏 0 人点赞
#tokenization

BrainJanus:一个统一的大脑、视觉与语言理解与生成模型

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

BrainJanus是首个统一的大脑模型,通过共享的Omni空间整合大脑、视觉与语言,利用分词表征和自回归下一个token预测实现神经活动与感官刺激的双向映射。

0 人收藏 0 人点赞
#tokenization

场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化

Hugging Face Daily Papers ↗ · 2026-06-28 缓存

本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。

0 人收藏 0 人点赞
#tokenization

非洲语言税:量化前沿大语言模型中分词非洲语言的成本、延迟和上下文惩罚

arXiv cs.CL ↗ · 2026-06-24 缓存

本文系统量化了20种非洲语言在11个前沿和开源分词器上的分词惩罚,发现推理成本和延迟最高可达8.9倍,有效上下文窗口仅为英语的11%,突显了子词词汇表中编码的结构性数字鸿沟。

0 人收藏 0 人点赞
#tokenization

情感分析的最佳预处理技术

arXiv cs.CL ↗ · 2026-06-24 缓存

本文系统研究了Twitter数据情感分析预处理技术的最佳顺序,发现分词影响最大,拼写纠正影响最小,最佳顺序为:分词、清洗、词干提取、停用词去除。

0 人收藏 0 人点赞
#tokenization

QuechuaTok:形态边界准确率作为黏着型低资源语言分词器评估的必要指标

arXiv cs.CL ↗ · 2026-06-24 缓存

本文介绍了QuechuaTok,一个用于评估南克丘亚语分词策略的基准,并引入了形态边界准确率(MorphAcc)作为必要指标。结果表明,BPE实现了低碎片率但形态准确性差,而基于形态感知的PRPE分词器达到了83%的MorphAcc,表明仅凭碎片率不足以评估黏着型语言的分词器。

0 人收藏 0 人点赞
#tokenization

星系的分词器指南:科学基础模型的基准测试

Hugging Face Daily Papers ↗ · 2026-06-24 缓存

本文在统一的transformer框架内,比较了四种分词方法(Affine、AIM、JetFormer、VQ-VAE)用于天文图像,使用64万张星系图像评估重构质量、物理属性预测和形态保持能力。研究发现,没有单一方法在所有任务中表现最佳,突显了表示学习中的权衡。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈