段落边界并非空白:压缩深度作为层次结构的特征

Hugging Face Daily Papers 论文

摘要

本文引入了层次旋转位置编码 (hRoPE) 来表示文本层次结构,并使用压缩深度作为段落结构的特征,表明它与其他指标相比,与真正的层次组织相关性更好。

标准位置编码将位置表示为一维阅读顺序坐标,但仅凭阅读顺序并不能决定文本的层次结构。我们使用层次旋转位置编码 (hRoPE),它将段落、句子和令牌索引表示为独立的通道,固定令牌序列,干预段落坐标 p1,并使用令牌距离精确估计器测量跨段落注意力。在每个语料库中,注意力相对于令牌距离匹配的基线被压缩,但仅压缩并不能诊断真实结构:一个架构相同但具有密度匹配随机标签的通道也被压缩了,但压缩得更浅。真正区分结构的是压缩深度,它更大且依赖于语料库,而控制组则不是。比较三个构念(词汇持久性、段落长度、基于嵌入的连贯性)中的八种仅语料库量度,没有一个能完全再现深度的跨语料库顺序,尽管基于嵌入的连贯性最接近。压缩深度,而不是其位置,是真正段落结构的可重复特征。
查看原文
查看缓存全文

缓存时间: 2026/09/28 12:04

论文页面 - 段落边界并非空白:压缩深度作为层次结构的特征

来源:https://huggingface.co/papers/2609.23551

摘要

标准位置编码将位置表示为一维阅读顺序坐标,但仅凭阅读顺序无法确定文本的层次结构。我们采用分层旋转位置编码(hRoPE),将段落、句子和词元索引表示为独立的通道,固定词元序列,对段落坐标p1进行干预,并通过词元距离精确估计器测量跨段落注意力。在所有语料库中,注意力相对于词元距离匹配的基线都被压缩,但仅凭压缩不足以诊断真实结构:架构相同、使用密度匹配随机标签的通道也被压缩,只是更浅层。真正区分真实结构的是压缩深度,它更大且依赖于语料库,而对照组则不然。通过比较八种仅依赖语料库的量与三种构念(词汇持久性、段落长度、基于嵌入的一致性),没有一种能完全复现深度跨语料库的排序,尽管基于嵌入的一致性最为接近。在我们的研究场景中,压缩深度(而非其位置)是真实段落结构的可重复特征。

查看 arXiv 页面 (https://arxiv.org/abs/2609.23551) 查看 PDF (https://arxiv.org/pdf/2609.23551) GitHub0 (https://github.com/ShuyangenFrance/hrope) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.23551)

引用本文的模型0

无模型关联本文 在模型 README.md 中引用 arxiv.org/abs/2609.23551 以从本页链接。

引用本文的数据集0

无数据集关联本文 在数据集 README.md 中引用 arxiv.org/abs/2609.23551 以从本页链接。

引用本文的 Spaces0

无 Space 关联本文 在 Space README.md 中引用 arxiv.org/abs/2609.23551 以从本页链接。

包含本文的收藏集0

无收藏集包含本文 将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

基于嵌套与层次重复的文本距离:一种压缩视角

arXiv cs.CL

本文提出了一种新的结构序列分析方法,采用Ladderpath方法提取嵌套和层次重复结构,定义了三种距离度量,在分布外和少样本文本分类任务中优于基于gzip的NCD和BERT,提供了一种轻量级、可解释的替代方案。

DepthBench:衡量残差连接如何实现更高的计算深度

Hugging Face Daily Papers

本文介绍了 DepthBench,一个通过改变宽度-深度比率来研究 Transformer 中计算深度的可控基准。研究发现,像 HC 和 FullAttnRes 这样的残差连接设计是将架构深度转化为有效计算的关键。

高维动态旋转位置编码 [P]

Reddit r/MachineLearning

介绍了 HDD-RoPE,这是旋转位置编码的一种扩展,它使用高维块和数据相关的旋转速率,在 TinyStories 数据集上显示出比 xPos 更快的收敛速度。