bpe

标签

Cards List
#bpe

TokEval:分词器评估套件

arXiv cs.CL · 2026-08-19 缓存

本文介绍了TokEval,一个用于评估语言模型分词器的框架,该框架利用与下游任务性能相关的内在指标。

0 人收藏 0 人点赞
#bpe

构建生产级智能体循环(9分钟阅读)

TLDR AI · 2026-08-19 缓存

Liquid AI进行了一项实验,其中编码智能体自主构建了一个名为toktoktok的生产级BPE分词器训练器,分享了关于设计有效的智能体循环和验证基础设施以解决实际问题的经验教训。

0 人收藏 0 人点赞
#bpe

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

arXiv cs.CL · 2026-08-12 缓存

This paper investigates whether released LLM tokenizer vocabularies can support fine-grained token-level estimation of hidden pretraining corpora, proposing a Quantile-Guided Density Estimation (QGDE) method that achieves low error rates in controlled and realistic settings.

0 人收藏 0 人点赞
#bpe

贪心最长匹配分词联合优化

arXiv cs.CL · 2026-07-28 缓存

本文提出JOLT,一种整数规划方法,用于优化基于从左到右贪心最长匹配解码(WordPiece)的子词分词。JOLT实现了近乎最优的压缩,缩小了BPE与理论下界之间的大部分差距,使token数量相比BPE最多减少0.78%。

0 人收藏 0 人点赞
#bpe

BHARATI:面向古典印度语言的形态感知分词器与子词丰富度分析

arXiv cs.CL · 2026-07-28 缓存

本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。

0 人收藏 0 人点赞
#bpe

在哪里切割,切割多深:化学SMILES中的BPE与Unigram-LM

arXiv cs.CL · 2026-07-08 缓存

本文系统比较了化学SMILES字符串的BPE和Unigram-LM分词方法,发现它们产生了几乎不相交的词汇表,并且在分割粒度上存在显著差异。结果表明,子词算法的选择是一个关键的建模决策,而不是一个免费的默认选项。

0 人收藏 0 人点赞
#bpe

quicktok: 一个更快的分词器(与tiktoken精确且字节一致)[P]

Reddit r/MachineLearning · 2026-06-16

quicktok 是一个快速且精确的 BPE 分词器,用 C++ 编写,与 tiktoken 字节一致,比现有替代方案快 2–11 倍。支持 cl100k、o200k、GPT-OSS、Llama-3 和 Qwen2.5/3 编码器。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈