SemHash-LLM:用于文档去重的多粒度语义哈希框架

arXiv cs.AI 论文

摘要

SemHash-LLM是一个多粒度语义哈希框架,结合了投影哈希、注意力加权MinHash、对比学习以及选择性LLM裁决,实现高效鲁棒的大规模文档去重。

arXiv:2607.01601v1 公告类型:新 摘要:大规模文档去重必须在保留语义等价的同时,在海量语料库上保持高效。我们提出了SemHash LLM,一个多粒度框架,统一了语义投影哈希、注意力加权MinHash、对比边界学习和基于选择性LLM的裁决。该方法通过门控融合结合字符级、词元级和文档级信号,然后应用级联过滤流水线进行高效的候选集缩减。语义投影哈希在蒸馏的LLM嵌入空间中学习紧凑的二进制码,而注意力加权Min-Hash抑制样板内容并强调信息性内容。自适应决策边界和不确定性估计进一步提高了对模板污染、短文本扰动、包含和病毒片段的鲁棒性。实验表明,SemHash LLM实现了强大的重复检测质量,且神经验证成本低于百分之一。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:44

# SemHash-LLM:一种用于文档去重的多粒度语义哈希框架
来源:https://arxiv.org/html/2607.01601

###### 摘要

大规模文档去重需在保持语义等价性的同时,在庞大数据集上保持高效性。本文提出SemHash-LLM,一种多粒度框架,统一了语义投影哈希、注意力加权MinHash、对比边界学习以及基于LLM的选择性裁定。该方法通过门控融合结合字符级、词元级和文档级信号,并采用级联过滤流水线实现高效的候选缩减。语义投影哈希在蒸馏后的LLM嵌入空间中学习紧凑的二进制编码,而注意力加权MinHash抑制模板噪声并强调信息性内容。自适应决策边界和不确定性估计进一步提高了在模板污染、短文本扰动、包含关系及病毒式片段等场景下的鲁棒性。实验表明,SemHash-LLM以不到百分之一的神经验证成本实现了强大的重复检测质量。

## I. 引言

现代数据流水线面临一个持续存在的困境:大型网络语料库需要激进地去重以提高效率和数据质量,然而严格的词法过滤往往会移除有用的语义变体,而语义方法在大规模场景下成本又过高。随着近期语言模型研究表明数据冗余会显著影响记忆、优化和下游质量[4 (https://arxiv.org/html/2607.01601#bib.bib1)],这一矛盾愈发重要。类似地,关于动态运行条件下鲁棒性的担忧也在物流和路由系统中有所研究[11 (https://arxiv.org/html/2607.01601#bib.bib13)]。与此同时,开放预训练语料库在规模和异质性上持续增长,使可规模化整理成为一个一阶系统问题[1 (https://arxiv.org/html/2607.01601#bib.bib2)]。

现有解决方案因仅优化权衡中的一个方面而难以为继。精确和近精确指纹方法速度快,但在释义、模板包装和小字符扰动下脆弱。纯基于嵌入的检索更具语义意识,但其计算和阈值设定成本在数十亿文档规模下难以控制。相关的大模型高效推理工作也在探索多级压缩和加速策略,以平衡精度与部署成本,包括自适应量化、词元剪枝和解码时优化[14 (https://arxiv.org/html/2607.01601#bib.bib12)]。这些挑战在现代语料库中尤为突出,因为这些语料库混合了长文档、短片段、模板密集型页面以及包含关系,并需在同一流水线中处理[9 (https://arxiv.org/html/2607.01601#bib.bib3)]。

我们通过SemHash-LLM解决了这一问题,这是一个统一框架,结合了学习型语义哈希、注意力加权词法草图、自适应对比决策边界和基于LLM的选择性精炼。我们的设计通过级联流水线进行剪枝、多粒度融合实现鲁棒性、不确定性感知路由(仅对罕见的边界情况应用昂贵推理),打破了传统效率与精度的折中。

## II. 相关工作

近期关于检索和匹配的工作表明,上下文感知的词元交互可以改善超越词袋指纹的细粒度相似性估计。COIL展示了通过上下文词元表示可以强化精确词法匹配,而ColBERTv2则通过轻量级后期交互提升大规模检索效率[2 (https://arxiv.org/html/2607.01601#bib.bib4)] [8 (https://arxiv.org/html/2607.01601#bib.bib5)]。这些研究启发了在保留词法精度的同时融入更丰富语义结构的去重系统。

高效的语义建模也通过紧凑编码器和对比表示学习取得了进展。SimCSE进一步证明了简单的对比目标可以生成具有清晰相似性结构的强句子嵌入[3 (https://arxiv.org/html/2607.01601#bib.bib6)]。我们的方法借鉴了这些思想,通过学习二进制语义投影和自适应重复边界,而非仅依赖固定的嵌入阈值。

第三条工作路线涉及基于模型的判断和置信度感知评估。MT-Bench和Chatbot Arena提供了证据,表明强大的语言模型可以作为细粒度比较的实用裁判[13 (https://arxiv.org/html/2607.01601#bib.bib7)]。G-Eval展示了精心设计的提示可以将LLM转变为可靠的结构化评估器[6 (https://arxiv.org/html/2607.01601#bib.bib8)]。SelfCheckGPT强调了在信任生成模型输出时不确定性信号的价值[7 (https://arxiv.org/html/2607.01601#bib.bib9)]。我们将这一方向扩展到文档去重,仅对自动流水线识别出的不确定候选对使用LLM判断。相关的多智能体LLM系统也展示了层级专业化与证据推理在复杂排故工作流中的价值[12 (https://arxiv.org/html/2607.01601#bib.bib14)]。动态检索和选择性工具调用的相关工作还表明,基于LLM的系统可以在证据不足时路由到检索证据和外部API,如DynaRAG所示[5 (https://arxiv.org/html/2607.01601#bib.bib11)]。

## III. 方法论

本节介绍SemHash-LLM,一个语义感知的分层去重框架,通过LLM集成将词法指纹与深度语义理解相连接。如图1 (https://arxiv.org/html/2607.01601#S3.F1)所示,我们的框架整合了五个核心组件,在多种表示粒度上运行——从字符扰动到词元模式再到文档级语义——并根据遇到的冗余类型自适应确定权重。语义投影哈希在LLM嵌入空间中学习局部敏感哈希函数,平衡相似性保持与量化损失及正交性约束。注意力加权MinHash通过从Transformer注意力模式中提取重要性权重到一致加权采样框架中,解决模板污染问题。对比边界学习通过对文档对分布进行基于边距的优化,提供自监督的自适应决策边界。对于具有高不确定性的边界情况,LLM-as-Judge机制通过置信度加权集成,将结构化模型判断与自动预测融合。这些组件统一在采用门控注意力的多粒度融合网络中,聚合字符级、词元级和语义级特征[10 (https://arxiv.org/html/2607.01601#bib.bib15)]。万亿级效率通过级联过滤流水线实现,该流水线结合了布隆过滤器、语义哈希分块和注意力加权LSH。该框架处理五类去重:模板包装的近重复、倾斜分布的热点文档、字符扰动的短文本、父子包含层级以及高频病毒式片段。

参见标题图1:SemHash-LLM框架概览。文档被编码为多粒度特征(字符、词元、语义级别),通过语义投影哈希和注意力加权MinHash处理以高效生成候选,并通过对比边界学习结合LLM-as-Judge对边界情况进行精炼。该流水线在统一架构内处理五类去重(A–E)。

### III-A 语义投影哈希

传统的局部敏感哈希方法(如MinHash和SimHash)在离散词元或n-gram表示上操作,从根本上限制了它们捕捉语义关系的能力。关于“汽车制造”的文档和关于“汽车生产”的文档尽管含义几乎相同,却会产生完全不同的哈希签名。这一局限性促使我们开发了语义投影哈希(Semantic Projection Hashing),它学习直接操作在连续LLM嵌入空间中的哈希函数。完整的SPH训练流程如图2 (https://arxiv.org/html/2607.01601#S3.F2)所示。

#### III-A1 嵌入提取与效率考虑

对于给定文档d及其内容c,我们首先通过预训练LLM编码器获得语义表示。在我们的实验中,使用特殊分类标记的最终隐藏状态这种直观方法被证明是次优的,因为它倾向于捕获全局文档统计信息而非细粒度语义内容。相反,我们采用对所有词元表示进行均值池化:

e = 1/T ∑_{t=1}^T h_t^{(L)}   (1)

其中h_t^{(L)} ∈ R^d是第L层中t词元的隐藏状态,T是序列长度。然而,对数十亿文档应用完整规模的LLM编码器在计算上不可行。这个效率瓶颈与Arm CPU上内存受限的LLM推理的屋顶线分析一致[15 (https://arxiv.org/html/2607.01601#bib.bib10)]。我们通过知识蒸馏解决这个问题,训练一个轻量级学生编码器来模仿大型教师模型的语义表示:

L_distill = KL(p_tea(e) ∥ p_stu(e)) + α‖e_tea - e_stu‖₂²   (2)

KL散度和L2距离的结合对于同时保持分布一致性和逐点精度至关重要。单独使用其中任一项会导致下游去重任务性能下降,仅KL训练会产生保留排序但失去对阈值决策重要的大小信息的嵌入。

参见标题图2:语义投影哈希。从LLM教师蒸馏得到的学生编码器产生语义嵌入,通过学习的超平面划分映射为紧凑二进制编码。训练目标联合优化相似性保持、正交性和比特平衡。

#### III-A2 可学习哈希函数设计

有了语义嵌入后,我们需要将其转换为适合高效相似性搜索的紧凑二进制编码。我们学习一族K个哈希函数,每个函数实现为嵌入空间的超平面划分:

h_k(e) = sign(w_k^T e + b_k)   (3)

其中w_k ∈ R^d和b_k ∈ R是可学习参数。完整的哈希码将所有K个比特连接起来:

z = [h_1(e), h_2(e), ..., h_K(e)] ∈ {-1, +1}^K   (4)

一个关键的设计决策涉及这些哈希函数的训练目标。传统SimHash中使用的随机超平面具有理论保证,但忽略了文档嵌入分布的具体结构。我们转而优化哈希函数以满足语义保持性质:

Pr[h_k(e_i) = h_k(e_j)] ≈ (1 + cos(e_i, e_j)) / 2   (5)

这是通过相似性保持损失实现的,该损失鼓励相似文档产生相似的哈希码:

L_sim = ∑_{i,j} (S_{ij} - (1/K) z_i^T z_j)^2   (6)

其中S_{ij} = cos(e_i, e_j)是目标语义相似度。然而,直接优化此目标会遇到符号函数带来的梯度不连续问题。我们在训练中通过直通估计器(straight-through estimator)解决,使用带温度退火的tanh作为平滑近似:

˜h_k(e) = tanh(β·(w_k^T e + b_k))   (7)

温度β在训练过程中逐渐增加,从1.0开始升至10.0,从软分配平滑过渡到硬二进制决策。

#### III-A3 正交性与信息最大化

当联合学习多个哈希函数时,会出现一个微妙但重要的问题:如果没有显式约束,它们倾向于收敛到相似的超平面,产生冗余比特,浪费有限的编码容量。我们通过正交正则化强制多样性:

L_orth = ‖W^T W - I_K‖_F^2   (8)

其中W = [w_1, ..., w_K] ∈ R^{d×K}堆叠所有超平面法向量。此外,我们观察到哈希码经常遭受比特不平衡,即某些比特在语料库中主要为正或负,降低了有效容量。我们添加了平衡正则化项:

L_bal = ∑_{k=1}^K (1/n ∑_{i=1}^n ˜h_k(e_i))^2   (9)

语义投影哈希的完整训练目标结合了这些组件:

L_SPH = L_sim + β₁ L_orth + β₂ L_bal + β₃ ‖W‖_F²   (10)

其中最后一项提供标准L2正则化以防止过拟合。通过在验证集上进行网格搜索,我们发现β₁=0.1、β₂=0.01、β₃=0.001能够在各种文档类型中提供良好的平衡。

### III-B 注意力加权MinHash

虽然语义投影哈希擅长捕获文档级语义相似性,但它可能忽略对某些去重类型重要的细粒度词法模式。标准MinHash通过n-gram指纹解决这个问题,但将所有n-gram视为同等重要,这在文档包含大量模板时会产生问题。考虑一篇包裹在网站导航菜单、Cookie同意通知和广告块中的新闻文章:具有区分性的新闻内容可能仅占总文本的一小部分,但标准MinHash会给模板n-gram赋予同等权重。图3 (https://arxiv.org/html/2607.01601#S3.F3)说明了如何从注意力中导出的重要性权重。

参见标题图3:注意力加权MinHash流水线。聚合的多头注意力分数突出具有区分性的内容,同时抑制模板。结合IDF加权,一致加权采样生成重要性感知签名,通过自适应LSH分组进行比较。

相似文章

基于双重语义嵌入的大语言模型鲁棒文本水印

arXiv cs.CL

本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。