ReconSpan:重构引导的自适应潜在分词

arXiv cs.CL 论文

摘要

ReconSpan 引入了一种自适应潜在分词方法,利用后向解码器将文本划分为可重构的块,从而实现可变长度的潜在标记以及训练后对粒度的控制。

arXiv:2608.12756v1 公告类型:新 摘要:自适应潜在分词将细粒度输入映射为与输入相关跨度关联的更短的连续表示序列。我们引入了 ReconSpan,它利用后向解码器从单个上下文前缀码重构文本块,并为每个块保留一个这样的码作为潜在标记。在块形成时应用重构标准,使得单个训练过的自编码器能够产生从 6.5 到 12.2 的平均块长度。在匹配的平均长度下,重构引导的边界比随机边界保留更多文本。阅读生成的潜在序列的读者能够可靠地获取主题信息,但在提取精确细节方面存在困难。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:27

# ReconSpan:基于重建指导的自适应潜在分词

来源:https://arxiv.org/html/2608.12756 \\workshoptitle基础模型的语言学原理 Lixing Li

###### 摘要

自适应潜在分词将细粒度输入映射为与输入相关片段关联的较短连续表示序列。我们提出*ReconSpan*,它将文本划分为可由反向解码器从单个上下文前缀码重建的块,并为每个块保留一个这样的码作为潜在标记。该重建准则在块形成时应用,使得单个训练好的自编码器能够产生6.5到12.2的平均块长度。在匹配的平均长度下,重建指导的边界比随机边界保留更多文本。对所得潜在序列的读者能够可靠地恢复主题信息,但在提取精确细节方面存在困难。

## 1 引言

语言模型并非直接对原始文本进行操作:分词决定了表示和计算所分配的序列位置。传统子词分词器在模型运行前选择这些单元,主要依据语料库级别的频率统计\(25 (https://arxiv.org/html/2608.12756#bib.bib1)\)。因此其粒度是固定的,而非根据实际输入进行调整。字节级和字符级输入避免了固定的子词词表,保留了细粒度信息,但也会产生更长的序列\(27 (https://arxiv.org/html/2608.12756#bib.bib2);20 (https://arxiv.org/html/2608.12756#bib.bib6)\)。自适应潜在分词则将相邻单元分组为依赖于输入的片段,并用一个连续的潜在标记表示每个片段。其分块规则至关重要:边界决定了何时创建新的潜在位置,从而决定了表示和计算的分配位置。这里,潜在标记是分配给片段边界的上下文表示;与传统标记嵌入不同,它可能编码先前的上下文以及相关联的片段。这使得单元形成成为一种依赖于模型的分配决策,而非固定的预处理选择。

我们提出*ReconSpan*,一种自适应潜在分词方法,它将文本划分为解码器可以从单个前缀码重建的块,并为每个块保留一个这样的码作为潜在标记。因果编码器在每个位置产生一个码;从最终码开始,反向解码器进行重建,直到超过误差准则,将所得后缀接受为一个块,然后从第一个未重建的位置重复该过程。重建范围的差异使得困难的片段获得较短的块,而较容易的片段获得较长的块。由于该准则仅在分块期间应用,它也可以在不重新训练的情况下放宽以增加平均块长度,从而使ReconSpan具备输入相关的分配和训练后的粒度控制能力。我们同时评估了所诱导的分词方案及其潜在标记中可获取的信息。ReconSpan产生6.5到12.2个标记的平均块长度,在匹配的平均长度下,其重建指导的边界比随机边界保留更多文本。原生重建通过自编码路径测试所选片段,而单独训练的*读者*直接消费上下文潜在标记并预测文本或任务输出。这些读者能够可靠地恢复主题信息,但在提取精确细节方面存在困难,这暴露了自编码器保留的信息与另一个模型可获取的信息之间的差距。我们的贡献如下:

- •我们引入了重建保真度作为在现有子词序列上进行自适应潜在分词的分块分配准则。
- •我们证明了一个自编码器支持多种训练后粒度,并且其可变片段边界在原生重建中优于长度匹配的随机边界。
- •我们通过直接读取来表征所得的上下文潜在标记,将自编码器保留的信息与不同规模和不同任务适应程度的读者可获取的信息区分开来。

## 2 相关工作

学习式分词器和层次序列模型在决定源文本块的信号上有所不同。我们按此分配规则组织最接近的工作。

#### 按固定位置分块。MEGABYTE将字节序列划分为固定大小的块,并在块内和块间分别应用局部和全局模型\(30 (https://arxiv.org/html/2608.12756#bib.bib3)\)。Extensible Tokenization则对现有子词嵌入进行上下文化,并以规则步长保留表示\(26 (https://arxiv.org/html/2608.12756#bib.bib4)\)。其步长可以在推理时选择,但等大小分配不能根据输入调整边界。它与ReconSpan尤为接近之处在于接受子词输入、输出连续的上下文表示、并允许在训练后改变粒度。

#### 按预测熵分块。Byte Latent Transformer \(BLT\)在下一字节熵的尖峰处创建可变字节块,在序列可预测性较低处分配较短的块\(20 (https://arxiv.org/html/2608.12756#bib.bib6)\)。Dynamic Token Pooling也研究了一种熵监督的边界预测器及其其他变体\(18 (https://arxiv.org/html/2608.12756#bib.bib5)\)。这些方法使用前向预测不确定性;ReconSpan则测量反向重建保真度。

#### 按语义相似性分块。SemToken对现有标记进行上下文化嵌入,合并相邻的语义相似片段,并随局部语义密度改变粒度\(13 (https://arxiv.org/html/2608.12756#bib.bib9)\)。这直接针对语义分配。ReconSpan不优化相似性,也不声称其边界是语义的;重建难度是否与语言结构对齐仍然是一个实证问题。

#### 按学习到的边界分数分块。Dynamic Token Pooling使用端到端、分词器监督、熵监督或语言目标来预测可变字符级片段\(18 (https://arxiv.org/html/2608.12756#bib.bib5)\)。H-Net与层次字节级语言模型联合学习内容和上下文相关的路由\(9 (https://arxiv.org/html/2608.12756#bib.bib7)\)。Charformer是更早的软块前身:它从端任务损失中为候选字节块打分,尽管其最终下采样是固定的\(27 (https://arxiv.org/html/2608.12756#bib.bib2)\)。FLEXITOKENS同样学习可变字节边界,同时放宽了相关模型使用的固定目标率目标\(19 (https://arxiv.org/html/2608.12756#bib.bib8)\)。在这些系统中,分配是作为语言建模的一部分进行训练的。

#### 按重建保真度分块。ReconSpan根据反向解码器能从每个上下文编码器状态成功重建多远来放置边界。该信号是测量的自编码器重建,而非固定位置、学习到的路由器、前向熵或语义密度。改变接受的重建准则可在训练后调整平均片段长度。我们的贡献在于这一分配准则以及对所得潜在表示的表征,而非连续标记或自适应分段本身。

## 3 方法

ReconSpan需要一个通用自编码模型和一个推理时的分块算法。

### 3.1 自编码模型

令x1:nx\_{1:n}为一个标记序列。ReconSpan需要两个学习组件。

- •*前缀编码器*将任意标记序列映射为一个码,E:V∗→Rd,ct=E\(x1:t\)。E:\\mathcal\{V\}^\{\*\}\\rightarrow\\mathbb\{R\}^\{d\},\\qquad c\_\{t\}=E\(x\_\{1:t\}\)。\(1\)因果模型如Transformer或Mamba可以一次前向传播生成c1,...,cnc\_\{1\},\\ldots,c\_\{n\}。
- •*反向解码器*将ctc\_\{t\}映射为编码标记的逆序形式,xt,xt−1,...x\_\{t\},x\_\{t\-1\},\\ldots。反向解码是设计的关键点:以最新优先的顺序解码,解码器首次失败的位置直接度量了该单个码能重建多远的过去。前向解码器反而必须被告知从哪里开始——而这正是我们想要度量的量。因此,ReconSpan基于可达范围的准则依赖于反向解码。

因此自编码路径为\(x1,x2,...,xt\)→Ect→D\(xt,xt−1,...,x1\)。\(x\_\{1\},x\_\{2\},\\ldots,x\_\{t\}\)\\xrightarrow\{E\}c\_\{t\}\\xrightarrow\{D\}\(x\_\{t\},x\_\{t\-1\},\\ldots,x\_\{1\}\)。\(2\)

### 3.2 分块算法

解码器无法重建任意长的前缀,因此我们只要求它在自身能力范围内解码;它失败的点设定每个块的边界,从而产生自适应长度的块及其潜在标记。算法1 (https://arxiv.org/html/2608.12756#algorithm1)陈述了该过程。由于被分词的文本是已知的,解码器对其*教师强制*:在每个反向步骤中,它被馈送真实的先前标记,我们仅记录其自身的贪婪 \(argmax\) 预测是否匹配——不进行任何采样或生成。将所得块端点按时间顺序写为0=b0τ。G\_\{k\}=\\sum\_\{j=1\}^\{k\}\\left\(\\max\_\{v\\in\\mathcal\{V\}\}z\_\{v\}^\{\(j\)\}\-z\_\{y\_\{j\}\}^\{\(j\)\}\\right\)\>\\tau。\(3\)当模型预测正确标记时,每个加数为零;否则度量其偏差程度,因此GkG\_\{k\}累积近乎命中的误差而非计入完全错误。提高mm或τ\\tau会在固定训练模型上延长块,从而增加每个潜在标记所表示的平均输入标记数。与架构无关的序列模型调用次数为O⁡\(1\+n\)O\(1\+n\)。产生所有前缀码c1,...,cnc\_\{1\},\\ldots,c\_\{n\}只需一次编码器前向传播,无论编码器架构如何。反向重建是自回归的,因此在最坏情况下——每一步都失败,使每个块只有一个标记——需要O⁡\(n\)O\(n\)次序列解码器调用。在实践中,解码器为每个端点读取固定的WW个位置的块以实现高效批处理,因此在我们特定的Mamba解码器下,最坏情况下解码工作量为O⁡\(Wn\)O\(Wn\)。附录D (https://arxiv.org/html/2608.12756#A4)描述了一个变体,它保持相同的O⁡\(Wn\)O\(Wn\)总工作量,但通过一次性物化所有端点解码,将顺序解码调用减少到O⁡\(W\)O\(W\),与nn无关,代价是更多的物理计算。

### 3.3 训练

唯一的训练目标是自编码器重建;片段分配从解码器的能力中涌现,而非来自显式的长度目标。一个训练步骤作用于一个窗口x1:Lx\_\{1:L\}。编码器产生其最终码cL=E\(x1:L\)c\_\{L\}=E\(x\_\{1:L\}\),一个学习到的投影将其映射到解码器的初始循环状态,解码器被教师强制以逆序重现该窗口,y=\(xL,...,x1,EOS\)y=\(x\_\{L\},\\ldots,x\_\{1\},\\mathrm\{EOS\}\)。每一步重建前k≤L\+1k\\leq L\+1个逆序目标,损失是它们的标记交叉熵,LAE=−∑j=1klogpD\(yj∣y水在100摄氏度沸腾,成吉思汗于1206年建立了蒙古∣\\mid帝国。单簧管有一个单簧∣\\mid片吹嘴,而光∣\\mid合∣\\mid作用将阳光转化为葡萄糖∣\\mid。拿破仑于1814年被流放到厄尔巴岛∣\\mid,但肝脏执行∣\\mid超过500∣\\mid种代谢功能。词内和标点相邻的分割清楚地表明,该示例本身并不意味着学习到的边界与语言单元重合。

## 附录 G 现有资产、许可证和条款

表7 (https://arxiv.org/html/2608.12756#A7.T7)和表8 (https://arxiv.org/html/2608.12756#A7.T8)报告了2026年8月从官方卡片和仓库验证的仓库标识符和许可证信息。实验记录固定了所使用的缓存修订版本。具有非商业或模糊条款的资产仅用于学术研究和评估,不进行再分发。

表 7:报告实验中所使用的数据集。“未指定”表示官方仓库未发布命名许可证;这不是推断的许可证。表 8:外部模型和基线资产。许可证限制适用于原始资产;本预印本不随附分发任何第三方权重。

#### 语言模型的使用。语言模型是核心实验组件:Pythia和Mamba构成自编码器,Pythia和Llama是读者,Qwen是外部困惑度评分器。它们的角色和训练在第3节 (https://arxiv.org/html/2608.12756#S3)和第5节 (https://arxiv.org/html/2608.12756#S5)中描述。LLM还用于写作、编辑和格式化辅助;它没有生成测量结果或确定实验结论。

相似文章

基于时间冗余掩蔽和潜在修补的自适应令牌化 [R]

Reddit r/MachineLearning

本文提出了一种自适应视频令牌化方法,利用潜在空间中的时间冗余动态分配令牌,实现高效压缩,无需辅助网络。所提出的潜在修补变压器(Latent Inpainting Transformer)重建被丢弃的位置,相比ElasticTok-CV实现31倍加速,相比InfoTok实现2倍加速。

基于门控关联检索的通用三重潜在压缩

arXiv cs.CL

本文介绍了通用三重潜在循环模型,该模型将令牌对交互压缩为潜在状态,并提出一种改进精确召回的门控关联检索变体。该混合模型在字节级WikiText-2和分词语言基准上优于Transformer,实现了高达41.9%的关联召回率(对比25%)。

大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展

arXiv cs.CL

本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。

ReToken:一个Token提升视觉语言模型的视觉检索能力

Hugging Face Daily Papers

ReToken引入了一个可学习的检索Token,从预填充的视觉KV缓存中选择与查询相关的稀疏视觉Token,从而提升视觉语言模型在视觉检索任务上的长上下文性能。它在图像和视频基准上均取得了一致的性能提升,同时可在单张H100上实现高效的长视频推理。