tokenization

标签

Cards List
#tokenization

词元边界的代价:压缩证书与预测

arXiv cs.AI ↗ · 13小时前 缓存

本文通过从上下两侧对最小词元数进行界定,量化了分词前边界规则的压缩代价,并证明了在英文维基百科上,正则边界会使最优词元数增加28.3%–36.8%;同时表明,以压缩最优化为目标构建的词元字典并不一定能提升语言模型的预测质量。

0 人收藏 0 人点赞
#tokenization

**同样的字节,不同的权限:聊天模板提示注入中的保留 Token 表示**

Hugging Face Daily Papers ↗ · 2天前 缓存

本文探讨了在聊天模板中使用保留令牌与子词令牌时,如何影响针对 LLM 智能体的提示注入攻击的成功率,并发现保留令牌会显著提高攻击的权限和成功率。

0 人收藏 0 人点赞
#tokenization

谁获得词元,它承载了什么?大型语言模型中的不平等名称支持与概念访问

Hugging Face Daily Papers ↗ · 2天前 缓存

论文表明,大型语言模型中对名称的不平等单词元支持导致跨人口统计学的偏见概念可访问性,并引入了NameTrace来衡量词汇可比性。

0 人收藏 0 人点赞
#tokenization

美式英语如何成为默认?跨LLM流水线结构偏差的三角测量

Hugging Face Daily Papers ↗ · 2天前 缓存

本文研究了美式英语如何在大型语言模型中成为默认,通过对美式英语和英式英语变体的对照研究,考察了预训练数据、分词和生成阶段的结构偏差。

0 人收藏 0 人点赞
#tokenization

生成每个LLM令牌宽度相同的字体

Hacker News Top ↗ · 4天前 缓存

此工具编译字体,其中每个LLM令牌宽度相等,配备各种分词器的预设,并提供Discord和Slack的集成选项。

0 人收藏 0 人点赞
#tokenization

面向 Brahmic Scripts 的类型驱动分词

arXiv cs.CL ↗ · 2026-09-22 缓存

该论文通过在 Agda 中形式化正字法约束并开发可证明正确的分词修复方案,解决了大型语言模型应用于 Brahmic Scripts 时的分词错误问题,并在 SentencePiece 和 Rust 库中实现了实际应用。

0 人收藏 0 人点赞
#tokenization

tokenizers v1 (Rust版)

Reddit r/LocalLLaMA ↗ · 2026-09-21

Hugging Face 发布了 tokenizers 库的版本1,支持多语言、多线程扩展,并具有最小的包体积。

0 人收藏 0 人点赞
#tokenization

超越原子标记:音节分解在语言模型预训练中的应用

arXiv cs.CL ↗ · 2026-09-21 缓存

本文介绍了一种基于语言学的音素分词器,用于越南语和中文,该分词器将音节分解为声母、韵母和声调成分,从而减小词汇表大小并提高效率。所提出的PhonemicBERT模型在语言理解任务中与现有的分词器和预训练模型相比,展示了具有竞争力或更优的性能。

0 人收藏 0 人点赞
#tokenization

tokenizers v1:编码、解码与扩展性能实测

Hugging Face Blog ↗ · 2026-09-21 缓存

Hugging Face 发布了 tokenizers v1,这是分词库的重大性能更新,基准测试显示与先前版本相比速度有显著提升。

0 人收藏 0 人点赞
#tokenization

从零开始的世界模型 2:模型训练与梦境生成 [P]

Reddit r/MachineLearning ↗ · 2026-09-19 缓存

本文详细介绍了使用 transformer 为 Super Mario Land 构建一个世界模型,通过标记化输入预测下一个游戏帧,并展示了自回归“梦境生成”来生成未来帧。

0 人收藏 0 人点赞
#tokenization

为何预训练无法共享跨语言知识

arXiv cs.CL ↗ · 2026-09-18 缓存

这篇研究论文探讨了为什么大型语言模型中的预训练无法跨语言转移知识,指出不相交的词元空间是根本障碍,并提出将语言映射到共享词元空间以改善跨语言泛化能力。

0 人收藏 0 人点赞
#tokenization

词少但词元不少:衡量梵语每命题的词化代价

arXiv cs.CL ↗ · 2026-09-14 缓存

本文测量了梵语与英语和印地语相比的词化成本,发现梵语由于其信息密度高,每命题需要更多词元,但随着词汇表大小的增加,惩罚会降低。

0 人收藏 0 人点赞
#tokenization

打破令牌天花板:蒸馏更小、更强的字节模型

arXiv cs.CL ↗ · 2026-09-14 缓存

本文进行了一项大规模研究,比较蒸馏的字节模型和令牌模型,发现字节模型在更多计算资源下能达到更高的性能上限,并且比令牌模型更高效利用数据。

0 人收藏 0 人点赞
#tokenization

使用令牌效率进行密钥扫描:罕见而非随机

Lobsters Hottest ↗ · 2026-09-12 缓存

本文探讨了使用 Byte-Pair Encoding (BPE) 令牌效率作为比熵更有效的替代方法来检测代码中的密钥,重点关注统计罕见性而非随机性。

0 人收藏 0 人点赞
#tokenization

@TCryptochicks: BNB Chain在过去一年中领先所有链,代币化美国国债市值增长,增加了令人印象深刻的39亿美元…

X AI KOLs Following ↗ · 2026-09-10 缓存

BNB Chain在过去一年中领先所有区块链网络,代币化美国国债市值增长,增加了39亿美元。

0 人收藏 0 人点赞
#tokenization

MEL:用于fMRI翻译的坐标保持型EEG标记化

arXiv cs.LG ↗ · 2026-09-01 缓存

本文介绍了MEL,一个用于EEG到fMRI翻译的坐标保持型EEG标记化框架,通过显式建模血流动力学延迟和频谱空间动态,解决表示接口不匹配问题,并改善预测性能优于基线方法。

0 人收藏 0 人点赞
#tokenization

噪声响应的普遍性何时出现?分词作为语言模型中的隐藏变量

arXiv cs.CL ↗ · 2026-08-28 缓存

研究发现,神经语言模型在单词级噪声下退化相似,但在字符级噪声下退化不同,分词被确定为关键隐藏变量。它提供了一种无需噪声评估即可预测模型鲁棒性的方法,并建议通过噪声增强训练来提升鲁棒性。

0 人收藏 0 人点赞
#tokenization

压缩中的迷失:抽取式提示压缩器的跨语言可控审计

arXiv cs.CL ↗ · 2026-08-28 缓存

本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。

0 人收藏 0 人点赞
#tokenization

苹果比苹果?迈向可比的跨语言语言模型评估

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。

0 人收藏 0 人点赞
#tokenization

方言税:方言偏见在语言建模流程中的持续存在

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究了方言偏见如何在整个语言建模流程中持续存在和累积,从分词到推理,表明差异在每一步都被编码。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈