标签
本文提出将'单元'作为机器学习中的显式原语,其中学习任务声明持久个体,而监督学习则特化为带有分词的单元条件响应法则。
本文讨论了Sander Land对Claude分词器的复现,揭示了其与Qwen 3.8等模型相比令人惊讶的小词汇量,并探讨了最近一篇论文中描述的语言模型softmax瓶颈的理论影响。
通过分词器比较、错误字符串分析和温度为 0 时的输出匹配,作者得出结论:Ox Alpha 很可能基于 GLM-5.3 模型,可能是其变体或更新版本。
NE-BERT 是一个多语言编码器模型,在830万句数据上训练,覆盖九种东北印度语言和两种锚定语言,通过自定义分词技术,在超低资源语言上显著优于现有模型如 IndicBERT-V2 和 MuRIL。
Liquid AI进行了一项实验,其中编码智能体自主构建了一个名为toktoktok的生产级BPE分词器训练器,分享了关于设计有效的智能体循环和验证基础设施以解决实际问题的经验教训。
This paper investigates whether released LLM tokenizer vocabularies can support fine-grained token-level estimation of hidden pretraining corpora, proposing a Quantile-Guided Density Estimation (QGDE) method that achieves low error rates in controlled and realistic settings.
本文介绍了Sampled-BPE,一个轻量级的标记级审计流水线,用于中文网络规模语料库,并应用它揭示了开放中文数据集和Common Crawl快照中广泛但不均匀的污染。文章还发布了一个包含超过63万条带上下文和解释的污染标记记录的分层数据集。
本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。
本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。
本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
Marcel Rød 宣布了 Gigatoken,一个分词器实现,比 HuggingFace 快 500-1000 倍,比 OpenAI 的 tiktoken 快 100 倍,使用 Rust 构建。
Gigatoken 是一个即插即用的替代 tokenizer,声称相比 HuggingFace 的 tokenizer 速度提升高达 1000 倍,支持许多常见的 tokenizer 和 CPU。
Gigatoken 是一个开源分词器,通过SIMD和缓存优化,相对于HuggingFace分词器实现了高达1000倍的加速,相对于Tiktoken实现了100倍加速。它支持作为现有分词器API的直接替代。
文章揭示了由于分词器差异,使用前沿模型的实际成本有显著不同,TypeScript在Claude上比GPT多消耗高达73%的代币,而这些信息并未在定价页面上显示。
Qwen-Music 是一个音乐生成模型,能够生成包含人声的高保真歌曲,支持文本生成音乐和翻唱歌曲生成。它采用了一种新颖的旋律思维链机制,并在 16 项客观指标中的 13 项上取得了最先进的结果。
本文探讨了仅使用闭源大语言模型聊天API的两个oracle查询来重构其分词器的可行性,该过程可能揭示模型的内部表示细节。
本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。
Anthropic 发布了 Claude Sonnet 5,该模型性能接近 Opus 4.8,价格更低,但采用了新的分词器,使得英文和代码的 token 数量增加约 30%,从而实际上提高了成本。
Anthropic 发布了 Claude Sonnet 5,改进了推理、工具使用和编码,但其更新的分词器将文本映射为更多令牌(最高1.35倍),尽管标价相同,但每个任务的实际成本增加;优惠价格适用至2026年8月31日。