Right Reset:通过前缀移除进行分块

arXiv cs.CL 论文

摘要

本文介绍了Right Reset (RR),一种基于前缀移除的探测方法,通过因果语言模型的隐藏状态保持来识别扁平化文本中的分块边界,恢复了47.7%的原始记录,而BGE基线为25.9%。

arXiv:2608.04330v1 公告类型:新 摘要:从因果语言模型中移除左侧上下文,会揭示一种有用的边界:在这种边界处,模型处理相同的右侧标记时几乎没有变化。我们将这一观察转化为前缀移除探测,并引入了Right Reset (RR),它衡量右侧隐藏状态轨迹的保持程度。一个动态规划程序将RR的边界分数转换为可变长度的分块。在通过删除分隔符和布局后拼接主题相似记录而形成的扁平化文本上,RR将47.7%的原始记录恢复为干净的单元,而BGE嵌入边界为25.9%,这是未经任务特定模型训练的最强常规基线。这种优势在渲染和OCR之后仍然存在。来自同一Qwen3-4B层的被动分数以及同规模指令模型的直接提示在扁平化记录上表现明显更差。在六种语言模型中,RR选择的切分点与未选择的候选边界相比,始终经历更少的局部输出干扰。在某些架构中,基于观测标记的似然比读出具有竞争力,这表明核心贡献在于干预本身:当表层结构较弱时,上下文依赖性本身可以提供边界信号。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:46

# Right Reset:通过前缀移除进行分块
Source: https://arxiv.org/html/2608.04330
(2026年8月)

###### 摘要

从因果语言模型中移除左侧上下文,会揭示一种有用的边界:在该边缘上,模型处理相同的右侧 token 时几乎不发生变化。我们将这一观察转化为前缀移除探测,并引入 Right Reset(RR),它衡量右侧隐藏状态轨迹的保持程度。一个动态规划程序将 RR 边缘分数转换为可变长度的块。在通过删除分隔符和版面后拼接主题相似记录形成的扁平文本上,RR 以干净单元形式恢复了原始记录的 47.7%,而 BGE 嵌入边界(无需任务特定模型训练的最强测试常规基线)为 25.9%。在渲染和 OCR 之后,这一优势依然存在。来自同一 Qwen3-4B 层的被动得分以及同规模指令模型的直接提示,在扁平记录上的表现都明显更差。在六种语言模型中,与未选中的候选边缘相比,RR 选择的切分所导致的局部输出扰动也始终更小。一个观察到 token 的似然比读出在某些架构中具有竞争力,这表明核心贡献在于干预本身:当表面结构较弱时,上下文依赖本身就可以提供边界信号。

关键词:Right Reset;文本分块;因果语言模型;隐藏状态;前缀移除;OCR 数据整理

## 1 引言

语言模型可以在移除其之前的所有内容后,仍以几乎相同的方式处理某些后续内容。这些点自然是块边界的候选位置:右侧在局部对左侧的依赖较弱。

当常规线索较弱时,这一信号就显得重要。大多数文本分块器依赖段落、句子

相似文章

Adaptive Chunking:为RAG优化分块方法选择

Papers with Code Trending

介绍Adaptive Chunking,一个利用五项文档内在指标为RAG选择最佳分块策略的框架,将答案正确率从62-64%提升至72%,并将问题解决率提高超过30%。

通过残差流动力学揭示无控制重复现象

arXiv cs.CL

本文提出了一种名为 Tokenwise Residual Comparison(TRC)的方法,该方法从 LVLMs/LLMs 生成过程中的残差流动力学中定位重复异常并进行选择性抑制,将循环率平均降低 57%,同时表明重复语义在浅层出现并随后向深层传播。