tokenizer

标签

Cards List
#tokenizer

朝向以单元作为原语的机器学习:从单元关联事件中学习

arXiv cs.LG · 2026-08-27 缓存

本文提出将'单元'作为机器学习中的显式原语,其中学习任务声明持久个体,而监督学习则特化为带有分词的单元条件响应法则。

0 人收藏 0 人点赞
#tokenizer

词汇解析 (4分钟阅读)

TLDR AI · 2026-08-26 缓存

本文讨论了Sander Land对Claude分词器的复现,揭示了其与Qwen 3.8等模型相比令人惊讶的小词汇量,并探讨了最近一篇论文中描述的语言模型softmax瓶颈的理论影响。

0 人收藏 0 人点赞
#tokenizer

我分析了 Ox Alpha 的指纹:与 GLM-5.3 使用相同的分词器(+75 个令牌偏移),z.ai 的确切错误信息,温度为 0 时输出几乎相同。

Reddit r/singularity · 2026-08-21

通过分词器比较、错误字符串分析和温度为 0 时的输出匹配,作者得出结论:Ox Alpha 很可能基于 GLM-5.3 模型,可能是其变体或更新版本。

0 人收藏 0 人点赞
#tokenizer

NE-BERT: 针对九种东北印度语言的多语言模型

arXiv cs.CL · 2026-08-20 缓存

NE-BERT 是一个多语言编码器模型,在830万句数据上训练,覆盖九种东北印度语言和两种锚定语言,通过自定义分词技术,在超低资源语言上显著优于现有模型如 IndicBERT-V2 和 MuRIL。

0 人收藏 0 人点赞
#tokenizer

构建生产级智能体循环(9分钟阅读)

TLDR AI · 2026-08-19 缓存

Liquid AI进行了一项实验,其中编码智能体自主构建了一个名为toktoktok的生产级BPE分词器训练器,分享了关于设计有效的智能体循环和验证基础设施以解决实际问题的经验教训。

0 人收藏 0 人点赞
#tokenizer

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

arXiv cs.CL · 2026-08-12 缓存

This paper investigates whether released LLM tokenizer vocabularies can support fine-grained token-level estimation of hidden pretraining corpora, proposing a Quantile-Guided Density Estimation (QGDE) method that achieves low error rates in controlled and realistic settings.

0 人收藏 0 人点赞
#tokenizer

基于采样BPE标记统计的中文网络级语料库审计

arXiv cs.CL · 2026-08-12 缓存

本文介绍了Sampled-BPE,一个轻量级的标记级审计流水线,用于中文网络规模语料库,并应用它揭示了开放中文数据集和Common Crawl快照中广泛但不均匀的污染。文章还发布了一个包含超过63万条带上下文和解释的污染标记记录的分层数据集。

0 人收藏 0 人点赞
#tokenizer

评估针对达罗毗荼语的专用单语模型与联合多语言因果模型

arXiv cs.CL · 2026-08-11 缓存

本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。

0 人收藏 0 人点赞
#tokenizer

KVAE:用于多模态生成模型的系列分词器

Hugging Face Daily Papers · 2026-08-06 缓存

本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。

0 人收藏 0 人点赞
#tokenizer

面向字节级BPE的书写系统级分词器适配

arXiv cs.CL · 2026-08-04 缓存

本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。

0 人收藏 0 人点赞
#tokenizer

Mage-VL:一种高效的编解码原生流式多模态基础模型

Hugging Face Daily Papers · 2026-07-27 缓存

Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。

0 人收藏 0 人点赞
#tokenizer

@percyliang: ! 分词是你在CS336(从头构建语言模型)中做的第一件事。如果Marcel能对LM流水线的其余部分施展魔法……

X AI KOLs Following · 2026-07-22 缓存

Marcel Rød 宣布了 Gigatoken,一个分词器实现,比 HuggingFace 快 500-1000 倍,比 OpenAI 的 tiktoken 快 100 倍,使用 Rust 构建。

0 人收藏 0 人点赞
#tokenizer

Gigatoken (GitHub Repo)

TLDR AI · 2026-07-22 缓存

Gigatoken 是一个即插即用的替代 tokenizer,声称相比 HuggingFace 的 tokenizer 速度提升高达 1000 倍,支持许多常见的 tokenizer 和 CPU。

0 人收藏 0 人点赞
#tokenizer

Gigatoken: 一个新的开源分词器,比Tiktoken快约100倍,比Huggingface快500-1000倍

Reddit r/LocalLLaMA · 2026-07-21 缓存

Gigatoken 是一个开源分词器,通过SIMD和缓存优化,相对于HuggingFace分词器实现了高达1000倍的加速,相对于Tiktoken实现了100倍加速。它支持作为现有分词器API的直接替代。

0 人收藏 0 人点赞
#tokenizer

前沿模型的真实价格。代币数乘以价格,对吧?

Hacker News Top · 2026-07-13 缓存

文章揭示了由于分词器差异,使用前沿模型的实际成本有显著不同,TypeScript在Claude上比GPT多消耗高达73%的代币,而这些信息并未在定价页面上显示。

0 人收藏 0 人点赞
#tokenizer

Qwen-Music 技术报告

Hugging Face Daily Papers · 2026-07-13 缓存

Qwen-Music 是一个音乐生成模型,能够生成包含人声的高保真歌曲,支持文本生成音乐和翻唱歌曲生成。它采用了一种新颖的旋律思维链机制,并在 16 项客观指标中的 13 项上取得了最先进的结果。

0 人收藏 0 人点赞
#tokenizer

仅通过聊天API的两个oracle查询能否重构闭源LLM的分词器?

Reddit r/LocalLLaMA · 2026-07-11

本文探讨了仅使用闭源大语言模型聊天API的两个oracle查询来重构其分词器的可行性,该过程可能揭示模型的内部表示细节。

0 人收藏 0 人点赞
#tokenizer

每百万Token的价格毫无意义

Hacker News Top · 2026-07-06 缓存

本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。

0 人收藏 0 人点赞
#tokenizer

Claude Sonnet 5 的新特性

Simon Willison's Blog · 2026-06-30 缓存

Anthropic 发布了 Claude Sonnet 5,该模型性能接近 Opus 4.8,价格更低,但采用了新的分词器,使得英文和代码的 token 数量增加约 30%,从而实际上提高了成本。

0 人收藏 0 人点赞
#tokenizer

Sonnet 5 - 其更新的分词器将相同文本映射为更多令牌(约为1.0–1.35倍,取决于内容),因此每个任务的成本可能更高。

Reddit r/ArtificialInteligence · 2026-06-30

Anthropic 发布了 Claude Sonnet 5,改进了推理、工具使用和编码,但其更新的分词器将文本映射为更多令牌(最高1.35倍),尽管标价相同,但每个任务的实际成本增加;优惠价格适用至2026年8月31日。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈