tokenization

标签

Cards List
#tokenization

@royvanrijn: 对于好奇的开发者,我构建了《大语言模型的解剖结构》,这是一个交互式解释器,展示了文本如何变成令牌、向量、注意力……

X AI KOLs Timeline ↗ · 2026-05-28 缓存

由 Roy van Rijn 构建的交互式可视化指南,解释了大语言模型的工作原理,从令牌化到注意力机制、Transformer 模块以及文本生成。

0 人收藏 0 人点赞
#tokenization

语言模型中跨语言泛化的体外研究

arXiv cs.CL ↗ · 2026-05-27 缓存

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

0 人收藏 0 人点赞
#tokenization

BrickAnything:基于几何条件的可构建砖块生成与结构感知标记化

arXiv cs.AI ↗ · 2026-05-27 缓存

BrickAnything是一种自回归框架,通过点云和结构感知树标记化,从多种3D表示中生成物理可构建的砖块结构,确保几何保真度和结构稳定性。

0 人收藏 0 人点赞
#tokenization

机器是在思考还是在分词?

Reddit r/artificial ↗ · 2026-05-26

本文介绍了SAPS(合成算法预测系统)框架,认为现代AI系统不是在思考,而是在分词并计算统计模式,并阐明了人工系统与合成系统之间的关键区别。

0 人收藏 0 人点赞
#tokenization

@gordic_aleksa: 新深度博文时刻:Inside the Transformer: The Life of a Token 对现代密集Transformer的深入探讨,我…

X AI KOLs Timeline ↗ · 2026-05-26 缓存

一篇深入探讨现代密集Transformer内部工作原理的博文,涵盖YaRN(位置信息)、混合注意力(实现160k上下文长度)、soft capping、QK归一化,以及Transformer数学(包括FLOPs/Token公式和集群规模估算)。

0 人收藏 0 人点赞
#tokenization

迷失于翻译?探究从拉丁语到奥克语语法性别的演变

Hugging Face Daily Papers ↗ · 2026-05-26 缓存

开发了一个深度学习框架,用于分析从拉丁语到罗曼语族的语法性别演变,重点是利用词汇和上下文分析处理低资源历史场景。

0 人收藏 0 人点赞
#tokenization

LLaVA-OneVision-2:迈向下一代感知智能

Hugging Face Daily Papers ↗ · 2026-05-25 缓存

LLaVA-OneVision-2 引入了编解码流分词和窗口注意力机制以实现高效的视频理解,在包括视频、空间和跟踪任务在内的多个多模态基准测试中取得了最先进的性能。

0 人收藏 0 人点赞
#tokenization

@shabnam_774: https://x.com/shabnam_774/status/2058517919760355729

X AI KOLs Timeline ↗ · 2026-05-24 缓存

本文提供了关于现代大型语言模型(如ChatGPT和Claude)从零开始构建的全面逐步解析,涵盖了数据收集、分词、Transformer架构、训练、对齐和部署。

0 人收藏 0 人点赞
#tokenization

@Tabbu_ai: https://x.com/Tabbu_ai/status/2058145123444347339

X AI KOLs Timeline ↗ · 2026-05-23 缓存

一篇教育性推文串,解释了理解和从头构建LLM架构的11个关键课程,涵盖token、嵌入、注意力、位置编码、数据质量和常见误解。

0 人收藏 0 人点赞
#tokenization

AI代理让代币化平台比我预想的更易用

Reddit r/AI_Agents ↗ · 2026-05-20

一位开发者分享了AI代理如何通过人类与系统的智能编排(而非完全自主)来改进代币化平台。

0 人收藏 0 人点赞
#tokenization

利用更优词元加速学习:面向专业文本摘要的参数高效词表适配

arXiv cs.CL ↗ · 2026-05-19 缓存

本文提出了一种针对专业领域LLM文本摘要的参数高效词表适配方法,通过扩充预训练分词器中的领域专用词元并选择性替换训练不足的词元,将训练时间减少35-55%,参数数量减少高达37%。

0 人收藏 0 人点赞
#tokenization

@nemild: Y Combinator 将于周四在纽约市举办金融科技欢乐时光活动。在考虑关于稳定币、代币化…的初创公司吗?

X AI KOLs Timeline ↗ · 2026-05-18 缓存

Y Combinator 将于周四在纽约市举办金融科技欢乐时光,邀请专注于稳定币、代币化、金融人工智能、代理商务和预测市场的初创公司。

0 人收藏 0 人点赞
#tokenization

Dywave:面向异构物联网传感信号的事件对齐动态分词框架

arXiv cs.LG ↗ · 2026-05-15 缓存

Dywave 是一个面向物联网传感信号的动态分词框架,利用基于小波的层次分解将分词与语义事件对齐,在五个真实数据集上实现了高达12%的准确率提升和75%的输入分词长度缩减。

0 人收藏 0 人点赞
#tokenization

基于微积分的端到端自动语音识别词汇量确定框架

arXiv cs.CL ↗ · 2026-05-15 缓存

本文提出了一种基于微积分的框架,利用一阶和二阶导数检验来估计端到端自动语音识别系统的最佳词汇量超参数,并在Librispeech语料库上提升了性能。

0 人收藏 0 人点赞
#tokenization

从词元到词元对:临床预测中大语言模型的提示高效压缩

arXiv cs.CL ↗ · 2026-05-13 缓存

本文介绍了 MedTPE,一种针对大语言模型电子健康记录的高效无损提示压缩方法,可显著降低临床预测任务中的词元长度和推理延迟。

0 人收藏 0 人点赞
#tokenization

Compute Optimal Tokenization (2分钟阅读)

TLDR AI ↗ · 2026-05-13 缓存

本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。

0 人收藏 0 人点赞
#tokenization

文本恐怖谷:大语言模型在信息检索任务中表现的非单调性下降

arXiv cs.CL ↗ · 2026-05-11 缓存

本研究探讨了“文本恐怖谷”现象,即随着词边界破坏程度的增加,大语言模型(LLM)在信息检索任务中的表现出现非单调性下降。作者提出了“模式转换假说”以解释这种U型性能曲线,并证明了该假说与现实世界中噪声文本输入的相关性。

0 人收藏 0 人点赞
#tokenization

@0xLogicrw: MiniMax 发布技术博客,披露其 M2 系列大模型无法输出人名「马嘉祺」的根因排查过程。排查从一个个例出发,最终揭示了一个波及整个词表近 5% 的系统性退化问题。 根本原因是大模型两个训练阶段的数据覆盖严重脱节。第一阶段(预训练)用海…

X AI KOLs Timeline ↗ · 2026-05-10

MiniMax 发布技术博客,深入分析其 M2 系列大模型在无法输出特定人名背后的系统性词表退化问题,揭示了预训练与后训练数据覆盖脱节导致的参数偏移,并提出了通过全量合成数据进行修复的有效方案。

0 人收藏 0 人点赞
#tokenization

人类打字习惯与Token计数

Hacker News Top ↗ · 2026-05-08 缓存

一篇博客文章探讨人类的打字习惯(如拼写错误、速记表达、填充词和空格)如何影响OpenAI和Claude分词器的Token计数,并指出常见的拼写错误可能会增加Token使用量和成本,而不会改变实际语义。

0 人收藏 0 人点赞
#tokenization

当非正式文本导致自然语言推理失效:分词失败、分布偏移及针对性缓解策略

arXiv cs.CL ↗ · 2026-04-21 缓存

# 分词失败、分布偏移及针对性缓解策略 来源:[https://arxiv.org/html/2604.16787](https://arxiv.org/html/2604.16787) ## 当非正式文本导致自然语言推理失效:分词失败、分布偏移及针对性缓解策略 ###### 摘要 我们研究了在将四种转换操作应用于 SNLI 和 MultiNLI 时,非正式表层形式如何降低 ELECTRA-small(14M)和 RoBERTa-large(355M)的自然语言推理准确率:俚语替换、表情符号替换、Gen-Z 填充词,以及它们的

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈