GVD:文档仓库的受控版本管理与去重

arXiv cs.AI 论文

摘要

GVD 引入了一个用于文档仓库中受控版本管理与去重的统一框架,通过使用双向规则对齐和冲突解决策略,结合本地编码器模型,在企业数据上实现高性能。

arXiv:2609.17696v1 公告类型:新 摘要:文档仓库持续演进。指南和策略被修订、取代并重新上传,因此相同内容以不同措辞反复出现,新版本对早期版本进行细化或与之矛盾。这些不一致性属于不断增长的整体集合,而非任何单个文档,然而现有工作将版本管理、重复检测和矛盾检测视为孤立的成对任务,一旦对标签就停止。我们提出 GVD(受控版本管理与去重),这是一个框架,统一了跨文档版本链接与规则级冲突解决,并在可审计的更新策略下运行。传入文档通过双向规则对齐分配到版本家族,其规则与家族记忆进行比较,以识别重复、矛盾、不对称细化和新知识,其中 Counterfactual Span Probing (CSP) 解决推理误分类为中性的相关对。特定关系策略抑制重复,并仅将重大变更升级以供审查,保留版本谱系作为审计跟踪。该管道完全在本地运行,无需大型语言模型。在对 59 个版本家族处理的 120 个企业文档进行的 140 次摄取中,GVD 在版本家族构建上达到 F1 为 0.97,在规则级一致性上达到 0.94,CSP 将规则一致性从 0.90 提高到 0.94。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:23

# 受控版本管理与文档仓库去重
来源:https://arxiv.org/html/2609.17696
## GVD:面向文档仓库的受控版本管理与去重

###### 摘要

文档仓库持续演进。指南和策略不断修订、替代、重新上传,导致相同内容以不同措辞反复出现,且新版本会对早期版本进行细化或产生矛盾。这些不一致性属于不断增长的集合整体,而非任何单一文档,但现有研究将版本管理、重复检测和矛盾检测视为孤立的成对标记任务,并在完成一对标注后即停止。我们提出GVD(受控版本管理与去重),这是一个在可审计的更新策略下,将跨文档版本链接与规则级冲突解决相统一的框架。新文档通过双向规则对齐被分配至版本族,其规则与族内记忆进行比对,以识别重复项、矛盾项、非对称细化项和新知识项,并通过反事实区间探测解决推理模型误判为中性的相关规则对。关系特定策略会抑制重复项,并仅将具有实质影响的变更升级以供审查,同时保留版本谱系作为审计追踪。该流程完全本地运行,无需大语言模型。在120份企业文档(处理为140次导入,涉及59个版本族)上,GVD在版本族构建上达到0.97的F1分数,在规则级一致性上达到0.94,其中CSP将规则一致性从0.90提升至0.94。

## 1引言

文档仓库并非静止不变。在企业、法律、财务、医疗和政府环境中,指南、操作策略和流程规范会随着需求变化而修订、替代和重新上传,因此仓库会积累同一文档的多个版本,以及重叠且有时相互矛盾的指导方针。仓库还包含多模态文档,涵盖文本、表格、图形、图表和图像(Gao et al. (2026); Dalvand et al. (2025b); Dalvand et al. (2025a))。重复项增加了冗余,矛盾项增加了歧义,而未经管理的修订使人难以判断哪个版本的规范是可信的。在受监管的环境中,这不仅是一个质量问题。组织需要知道某条规则的哪个版本是生效的,什么取代了它,以及谁批准了这项变更。

现有工作将文档相似度、重复检测和矛盾检测视为针对固定集合的独立成对标记任务,并在完成一对标注后即停止。管理一个活跃的仓库则要求更多。新内容必须与其修订的历史版本建立链接,与已有内容进行协调,并以可供后续检查的方式记录下来。其中一些决定是常规性的,而另一些则具有足够的重要性,需要人工介入,区分两者是随着集合增长仍能保持审查成本可负担的关键。

我们提出GVD(受控版本管理与去重),该框架将文档内容表示为规范化的规则,并通过两个阶段管理集合。第一阶段通过双向规则对齐将每个新文档分配到一个版本族中,这样简短的修订不会被吸收到更大的族中。第二阶段将其规则与族内记忆进行比较,并将每一对规则标注为重复、矛盾、非对称细化或新知识项。然后,关系特定策略根据这些标注采取行动:抑制重复项,插入新知识项,仅将具有实质影响的变更升级以供审查,并将每个已接受的变更与其引入的修订相关联。该流程在编码器规模的模型上本地运行,无需大语言模型,因此文档内容永远不会离开部署环境。

据我们所知,GVD是第一个将一致性关系转化为针对动态演进集合的仓库更新策略,而非仅停留在分类层面的框架。我们的贡献包括:

1. 一种版本链接方法,通过双向规则覆盖度将文档分组为族,对长度和措辞不同的修订具有鲁棒性。
2. 一种受控更新策略,根据一致性关系采取行动,仅将具有实质影响的变更升级以供审查,并保留版本谱系作为审计追踪,其路由决策通过专家审查验证。
3. 反事实区间探测(CSP),一种轻量级的免训练机制,用于区分表面性措辞修改与实质性编辑,防止改头换面的重复项作为新规则进入集合。

## 2相关工作

文档相似度与版本管理。诸如分片、SimHash(Williams and Giles, 2013)和Sectional MinHash(Hassanian-Esfahani and Kargar, 2018)等词汇指纹方法在遇到释义时性能下降,并产生二元的重复判断结果,未对版本族进行建模。语义方法则将词嵌入距离应用于无监督的修订检测(Zhou et al., 2019; Zhu et al., 2017; Sediqin and Argamon, 2025b),并将上下文嵌入应用于跨版本的句子级对齐(Spangher et al., 2024b; Sediqin and Argamon, 2025a),但其操作粒度较粗,且未强制执行双向一致性。GVD在规则层面操作,并要求双向一致性。

去重与矛盾检测。由于纯粹的相似性无法区分语义相近与逻辑冲突(Das et al., 2021; Shambour et al., 2022),需求工程领域的工作转向使用自然语言推理(NLI)将成对规则分类为重复、冲突或中性(Malik et al., 2023),采用混合嵌入模型(Saleem et al., 2026)以及检索与分类流程处理重复的错误报告(Ariai et al., 2025)。这些方法将检测视为成对分类问题,并未对仓库级决策进行建模,例如某条规则应保留、抑制、升级还是作为新增项添加。GVD将语义分类扩展为一个结合检索、双向推理、非对称关系检测和更新策略的仓库维护工作流。

人在回路审查。自动分类留下了需要人工判断的模糊案例(de Sá Baldaia, 2020),然而先前工作孤立地处理文档级重复和规则级不一致,未对动态演进的集合进行治理(Surana et al., 2022; Dalmia et al., 2026),且人在回路的流程(Wu et al., 2022)在分类后即停止,而未基于分类结果采取行动。GVD尽可能自动解决模糊案例,并将矛盾项、非对称细化项以及值或极性变更路由以进行验证,无需干预即可处理常规更新。

## 3系统框架

GVD是一个用于演进文档仓库的治理框架。随着文档被修订、重新上传和扩展,仓库会积累重复项、冲突指令、重叠指导以及相关流程的多个版本。现有方法将版本管理、重复检测和矛盾分析视为独立任务,而GVD将它们统一为一个单一的更新策略,在纳入新内容前对其进行评估,以确保集合在演进过程中保持一致性。

GVD并非直接操作原始文档,而是基于共享的规则级表示进行推理,这使得更细粒度的一致性推理成为可能,同时降低了对格式和释义的敏感性。传入的PDF、DOCX和PPTX文档首先通过独立的多模态预处理管线转换为RuleUnits,并在导入前通过人在回路审查批准;因此GVD仅操作于经过验证、人工批准的规则,并专注于维护存储库内的一致性,而非生成或验证规则本身。形式上,文档表示为 D={r₁, r₂, ..., rₙ},其中每个规则嵌入 rᵢ ∈ ℝ³⁸⁴ 使用 all-MiniLM-L6-v2 句子编码器生成,该编码器提供轻量级的384维表示,同时保持强大的语义检索性能。两个阶段都使用相同的编码器,以确保文档检索、版本匹配和规则级一致性分析具有一致的嵌入空间,如图1所示。

(参考图标题)图1:GVD概览。传入文档被转换为经验证的RuleUnits,并经过两个阶段处理:(1)版本维护将文档分配到族中,(2)规则维护通过双向NLI和CSP将规则分类为一致性关系。然后,关系特定策略更新存储库,自动抑制重复项,并将具有实质影响的变更路由以供人工审查。### 3.1阶段一:版本维护

此阶段的目标是确定一个传入文档是否属于现有的版本族,还是应作为新知识初始化一个新族。这并非易事,因为同一指南文档的连续版本在内容和规则数量上往往差异很大:新修订可能增加、删除或重新表述规则,因此同一族中的两个文档不需要包含相同数量的规则或完全相同的文本。因此,阶段一分为两个步骤进行:先进行基于质心的快速检索,再进行更严格的双向对齐。

阶段1A:质心检索。每个文档通过其规则嵌入的质心来概括:

$$
\mathbf{c}_D = \frac{1}{|D|} \sum_{i=1}^{|D|} \mathbf{r}_i,
$$

其中 |D| 是文档中的规则数量。对于传入文档 D_q 和存储文档 D_j,质心相似度通过余弦相似度计算:

$$
\mathrm{sim}(D_q, D_j) = \frac{\mathbf{c}_{D_q} \cdot \mathbf{c}_{D_j}}{\lVert\mathbf{c}_{D_q}\rVert \, \lVert\mathbf{c}_{D_j}\rVert}.
$$

保留超过检索阈值的前 k 个文档作为候选文档,从而在更昂贵的规则级比较之前缩小搜索空间。

阶段1B:双向对齐。然后每个候选文档进行规则级对齐,其中两个规则之间的相似度为:

$$
s(\mathbf{r}_i, \mathbf{r}_j) = \frac{\mathbf{r}_i \cdot \mathbf{r}_j}{\lVert\mathbf{r}_i\rVert \, \lVert\mathbf{r}_j\rVert}.
$$

前向覆盖度衡量传入文档中有多少规则在候选文档中得到体现:

$$
S_f = \frac{1}{|D_q|} \sum_{\mathbf{r}_i \in D_q} \mathbb{I}\!\left( \max_{\mathbf{r}_j \in D_c} s(\mathbf{r}_i, \mathbf{r}_j) \geq \tau \right),
$$

而反向覆盖度衡量相反的情况:

$$
S_r = \frac{1}{|D_c|} \sum_{\mathbf{r}_j \in D_c} \mathbb{I}\!\left( \max_{\mathbf{r}_i \in D_q} s(\mathbf{r}_i, \mathbf{r}_j) \geq \tau \right).
$$

传入文档通过双重覆盖决策加入现有族:仅当两个方向的覆盖分数都超过版本阈值时才加入:

$$
(D_q, D_c) \in F \iff S_f \geq \tau_v \land S_r \geq \tau_v.
$$

要求双向一致,而非单向相似,可以防止一小组规则被错误地吸收进更大的族中,即使版本在长度或措辞上存在差异,也能更可靠地描绘文档演进过程。

### 3.2阶段二:规则维护

完成版本分配后,传入文档进入其版本族,其规则与族内记忆(包含先前与该谱系关联的所有已验证规则,包括来自早期修订、历史版本和已接受仓库更新的规则)进行比对。因此,一致性判断不仅基于当前文档,还要基于整个版本族积累的知识。阶段二分为三个步骤:余弦相似度预过滤检索候选规则、双向推理分配一致性标签,以及反事实区间探测量解决残余的中性规则对。

阶段2A:相似度预过滤。对于每个传入规则,余弦相似度用于识别族内记忆中最相关的候选规则。如果某规则的最佳相似度低于阈值 τ_s,则在存储库中没有匹配项,直接作为新知识插入;只有相似度达到或超过 τ_s 的规则对才进入推理阶段。我们设置 τ_s = 0.85。

阶段2B:双向推理。对于每个候选对,使用在 SNLI 和 MultiNLI 上微调的 DeBERTa-v3-large 模型进行两个方向的推理。令 P_e^→ 和 P_e^← 分别表示从现有规则到新规则以及从新规则到现有规则的蕴含概率,P_c 为矛盾概率。该对被标记为:

$$
\mathrm{Label} = \begin{cases}
\text{Contradiction}, & \max(P_c^\rightarrow, P_c^\leftarrow) \geq \tau_c, \\
\text{Duplicate}, & P_e^\rightarrow \geq \tau_d \land P_e^\leftarrow \geq \tau_d, \\
\text{Asymmetric}, & (P_e^\rightarrow \geq \tau_d) \oplus (P_e^\leftarrow \geq \tau_d), \\
\text{Neutral}, & P_e^\rightarrow < \tau_d \land P_e^\leftarrow < \tau_d,
\end{cases}
$$

其中 → 和 ← 分别表示 r_exist → r_new 和 r_new → r_exist 的方向,⊕ 表示异或。当两个方向都满足蕴含时,该对为重复项;当仅在一个方向满足蕴含时,为非对称项(捕获文档演进过程中常见的细化和部分扩展);当两个方向都不满足蕴含且无矛盾时,为中性项。

阶段2C:反事实区间探测。双向推理能可靠地识别明确的重复项和矛盾项,但许多语义相关的规则被归类为中性类,其中隐藏的重复项和非对称细化项仍未被发现。CSP是一种免训练的精炼方法,仅应用于中性对,旨在恢复单次推理会合并到中性类中的潜在重复和非对称关系。

相似文章

SGD-KV: 摘要引导的KV缓存压缩

arXiv cs.CL

SGD-KV是一个框架,利用摘要来指导大型语言模型中的KV缓存压缩,在上下文长度高达100万token时,将内存使用量减少高达75%,同时在长上下文基准测试中实现最先进的性能。

VeriGate:用于GRPO的验证器门控步级监督

arXiv cs.LG

VeriGate通过验证器门控步级监督扩展了GRPO,在验证器奖励退化时提供细粒度的信用分配。在1.5B和7B模型的推理基准测试上实现了显著的准确率提升。