tokenization

标签

Cards List
#tokenization

超越分词:面向时间序列问答的直接时间步嵌入与对比对齐

arXiv cs.CL ↗ · 2026-06-18 缓存

本文介绍CADE,一个用于时间序列问答的框架,它直接将每个时间步映射到LLM嵌入空间,并使用单向监督对比损失将时间序列表示与冻结的文本锚点对齐,在Time-MQA基准测试上超越了现有基线。

0 人收藏 0 人点赞
#tokenization

Morpheus:一种面向土耳其语的形态感知神经分词器与词嵌入器

arXiv cs.CL ↗ · 2026-06-18 缓存

本文提出Morpheus,一种面向土耳其语的神经分词器与词嵌入器,它在无需字符串归一化的情况下学习语素边界,实现了无损分词并在词汇检索中获得了具有竞争力的嵌入表示,同时比子词分词器使用更少的GPU内存。

0 人收藏 0 人点赞
#tokenization

大型语言模型中的涌现式重分词对称性:现象学与应用

arXiv cs.CL ↗ · 2026-06-16 缓存

本文发现,大型语言模型在重分词下部分表现出涌现式对称性——即在不改变字节的情况下,将提示的标准分词替换为另一种有效的分词方式。作者利用这一现象来探究组合理解能力,并提出将重分词作为一种新颖的推理时采样策略,能够恢复传统温度采样无法找到的解。

0 人收藏 0 人点赞
#tokenization

PACUTE:面向菲律宾语的音韵、词缀与字符级令牌理解

arXiv cs.CL ↗ · 2026-06-16 缓存

介绍PACUTE,一个包含4600项任务的诊断基准,用于评估菲律宾语的形态理解能力。结果显示,即使是前沿模型在语素分解和能产性形态组合方面仍存在困难。

0 人收藏 0 人点赞
#tokenization

兼顾公平与效率:多语言大语言模型分词器的实证研究

arXiv cs.CL ↗ · 2026-06-16 缓存

本文系统比较了涵盖11种东南亚语言的公平性分词器在多语言大语言模型中的表现,发现Parity-aware BPE在效率与公平之间取得了最佳平衡,并且跨语言公平性与分词效率并非根本冲突。

0 人收藏 0 人点赞
#tokenization

字节级模型

Reddit r/LocalLLaMA ↗ · 2026-06-15

讨论了字节级分词器是否在精确任务(如区分相似名称、计数字符和大小写敏感)上优于子词分词器,并询问当前推荐。

0 人收藏 0 人点赞
#tokenization

@freeman1266: 不懂数学,也能看懂大多数 AI 论文——只要理解这条链路: token → embedding → 位置编码 → attention → FFN → 残差流 → next-token prediction LLM 本质上是把 Transf…

X AI KOLs Timeline ↗ · 2026-06-15 缓存

一条中文科普推文,用直观方式解释了LLM(大语言模型)的核心链路:从token、embedding、位置编码、attention、FFN到残差流和next-token prediction,帮助非数学背景读者理解AI论文。

0 人收藏 0 人点赞
#tokenization

@CamilleRoux: 对LLMs内部工作原理的精彩解释:tokens、embeddings、positional encoding、attention、feed-forward…

X AI KOLs Timeline ↗ · 2026-06-14 缓存

这条推文分享了一篇关于LLMs内部工作原理的详尽解释,涵盖了tokens、embeddings、positional encoding、attention和feed-forward网络,来源于0xkato的一篇博文。

1 人收藏 1 人点赞
#tokenization

寻找最优分词器

Hacker News Top ↗ · 2026-06-11 缓存

这篇博客文章提出一个使用整数线性规划的算法来计算语言模型的最优分词器,并将其与解决旅行商问题相类比。文中指出,虽然结果在理论上很有趣,但实际的分词器已经接近最优,并且该方法可能不具备良好的泛化能力。

0 人收藏 0 人点赞
#tokenization

Visa和OpenAI让AI代理使用Visa全球网络代你购物

Reddit r/artificial ↗ · 2026-06-11 缓存

Visa与OpenAI合作,使得AI代理能够使用令牌化的Visa凭证代用户进行购买,并设有用户可控制的消费限额和欺诈监控,该合作得到了微软、IBM、Anthropic、三星和Stripe的支持。

0 人收藏 0 人点赞
#tokenization

@pallavishekhar_: 逐步学习LLM内部原理 - 从分词到注意力到推理优化 - BPE - 分词 - Tran…

X AI KOLs Timeline ↗ · 2026-06-09 缓存

一条推文,推广逐步学习LLM内部原理的资源,涵盖分词、注意力机制和优化技术。

0 人收藏 0 人点赞
#tokenization

@Potatoloogs: LLM 内部究竟怎么运作:从 token 到 next-token,九个核心机制完整梳理 a)Tokenization:模型读的不是文字,是整数 · 文本先被切成 subword 片段,再映射成整数 ID;现代 LLM 词表通常有数万到数…

X AI KOLs Timeline ↗ · 2026-06-08 缓存

本文从 tokenization 到 next-token 预测,系统梳理了现代 LLM 内部的九个核心机制,包括 tokenization、embedding、位置编码、注意力、多头注意力、前馈网络等,并比较了不同模型的架构差异。

0 人收藏 0 人点赞
#tokenization

大语言模型实际工作原理

Lobsters Hottest ↗ · 2026-06-07 缓存

深入剖析现代大语言模型的工作原理,涵盖从分词到下一个词预测的核心机制,无需复杂数学知识。

0 人收藏 0 人点赞
#tokenization

利用自引导标记化平衡图像压缩与生成

arXiv cs.LG ↗ · 2026-06-05 缓存

介绍了SelfBootTok,一种自引导标记化方法,它将全局和局部信息分离,使生成器计算量减少约40%,仅用64个标记即实现了1.56的gFID新最先进水平。

0 人收藏 0 人点赞
#tokenization

自适应分块在时间序列预测中比看起来更难实现

arXiv cs.LG ↗ · 2026-06-04 缓存

本文从理论和实验两个角度对时间序列 Transformer 的自适应分块方法进行了深入研究,推导出内容自适应分词应优于调优后的均匀分块的条件。在标准基准上的受控实验表明,经过良好调优的均匀基线与动态分块方法具有相当的竞争力,这对自适应方法所假设的优势提出了质疑。

0 人收藏 0 人点赞
#tokenization

LDARNet:用于基因组建模的具有可学习分词的DNA自适应表示网络

arXiv cs.CL ↗ · 2026-06-04 缓存

LDARNet 是一个拥有1.2亿参数的层次化基因组基础模型,引入了可学习的自适应分词机制(灵感来源于 H-Net 的动态分块),用于DNA序列的掩码语言建模。该模型在5项组蛋白修饰任务上取得了最先进的结果,并在多项基因组基准测试中超越了参数量多达其20倍的模型。其学习到的分词边界与启动子motif和剪接位点等生物学特征高度吻合。

0 人收藏 0 人点赞
#tokenization

@MaximeRivest: 开源LLM中的工具调用在不同模型间差异巨大。我刚刚搭建了:http://chattemplatepl…

X AI KOLs Following ↗ · 2026-06-03 缓存

一个新的在线工具Chat Template Playground,让用户可视化查看不同开源LLM渲染其聊天模板的方式,突出显示了提示和分词上的差异。

0 人收藏 0 人点赞
#tokenization

MeshWeaver: 稀疏体素引导的表面编织用于自回归网格生成

Hugging Face Daily Papers ↗ · 2026-06-03 缓存

MeshWeaver 提出了一种自回归网格生成框架,它使用多级稀疏体素编码器直接预测顶点,为高多边形网格实现了最先进的压缩率和几何保真度。

0 人收藏 0 人点赞
#tokenization

增量BPE分词

arXiv cs.CL ↗ · 2026-06-01 缓存

本文介绍了一种增量式字节对编码(BPE)分词算法,该算法处理每个字节的时间复杂度为 O(log^2 t),支持流式场景下的高效部分分词,并相比现有实现实现了加速。

0 人收藏 0 人点赞
#tokenization

Agentic RL: Token-In, Token-Out Done Right (16 minute read)

TLDR AI ↗ · 2026-06-01 缓存

This article explains the 'Token-In, Token-Out' (TITO) invariant in reinforcement learning for LLMs, highlighting a common error when training multi-turn agents with tool calls. It presents two solutions: using per-model renderers or designing training to avoid re-encoding decoded tokens, emphasizing prefix-preserving chat templates.

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈