ReLTEx:基于LLM的可靠分类法扩展
摘要
ReLTEx是一个基于LLM的可靠分类法扩展框架,它将LLM驱动的候选生成与结构感知验证及递归扩展控制相结合,以减少幻觉并提高一致性。在基准分类法上的实验表明,它能够产生更可靠且语义连贯的扩展。
arXiv:2608.10970v1 公告类型:新
摘要:近年来,大型语言模型(LLM)的进展展示了其在生成语义相关概念和关系方面的强大能力,使其成为分类法扩充的有力工具。然而,直接依赖LLM生成的扩展往往会导致噪声、冗余或层级不一致的结构,限制了其在自动分类法扩展中的可靠性。在本文中,我们提出了ReLTEx,一个基于LLM的可靠分类法扩展框架。ReLTEx结合了LLM驱动的候选生成与结构感知验证及递归扩展控制,通过减少幻觉来提高生成分类法的一致性和质量。我们在掩码分类法扩展设置下使用基准分类法评估了所提出的框架,并比较了多种验证策略。实验结果,辅以适配的评估指标和人工评估,表明ReLTEx能够产生更可靠且语义连贯的分类法扩展。
查看缓存全文
缓存时间: 2026/08/12 08:38
# ReLTEx:基于LLM的可靠分类法扩展
来源:https://arxiv.org/html/2608.10970
Zeinab Ghamlouch 隶属机构:Télécom Paris, Institut Polytechnique de Paris, France zeinab\.b\.ghamlouch@gmail\.com mehwish\.alam@telecom\-paris\.fr
Mehwish Alam 隶属机构:Télécom Paris, Institut Polytechnique de Paris, France zeinab\.b\.ghamlouch@gmail\.com mehwish\.alam@telecom\-paris\.fr
###### 摘要
大型语言模型 \(LLM\) 的最新进展已在生成语义相关的概念和关系方面展现出强大的能力,使其成为分类法扩充的有力工具。然而,直接依赖 LLM 生成的扩充往往会导致结构嘈杂、冗余或层级不一致,从而限制了其在自动分类法扩展中的可靠性。在本文中,我们提出了 ReLTEx,一个基于LLM的可靠分类法扩展框架。ReLTEx 将 LLM 驱动的候选生成与结构感知验证和递归扩展控制相结合,通过减少幻觉来提高生成分类法的一致性和质量。我们在掩蔽分类法扩展设置下使用基准分类法评估了所提出的框架,并比较了多种验证策略。实验结果,辅以调整后的评估指标和人工评估,表明 ReLTEx 能够产生更可靠、语义更连贯的分类法扩展。
## 1 引言
分类法提供了知识的结构化层级表示,在众多应用中扮演着基础性角色,包括知识图谱12 (https://arxiv.org/html/2608.10970#bib.bib4)、语义搜索和问答系统7 (https://arxiv.org/html/2608.10970#bib.bib5) 等。通过将概念组织为父子关系,分类法能够实现语义理解、高效导航和知识发现。然而,随着领域演进和新概念不断涌现,手动维护和扩展分类法变得越来越昂贵、耗时且难以规模化7 (https://arxiv.org/html/2608.10970#bib.bib5)。
为应对这些挑战,大量研究致力于自动化分类法扩展。早期方法依赖于词汇句法模式3 (https://arxiv.org/html/2608.10970#bib.bib6),随后是分布语义方法19 (https://arxiv.org/html/2608.10970#bib.bib8) 和基于图的技术9 (https://arxiv.org/html/2608.10970#bib.bib7)。此外,预训练语言模型 \(PLMs\) 通过学习概念和层级关系的上下文表示,显著改善了分类法扩展4 (https://arxiv.org/html/2608.10970#bib.bib9)。尽管取得了这些进展,自动分类法扩展仍然具有挑战性。生成的概念可能*语义模糊*,例如“Bank”,既可以指金融机构,也可以指河岸。候选生成也可能引入*噪声或冗余*,例如同时提议“Question”和“Inquiry”。此外,一个本身有效的概念可能被*附加到不合适的父节点*,例如将“Answer”置于“CreativeWork”而不是“Comment”之下。这些错误可能损害层级连贯性,并在递归扩展过程中传播。
大型语言模型 \(LLMs\) 的最新进展为分类法扩充创造了新的机遇,这些方法使用提示进行分类法构建18 (https://arxiv.org/html/2608.10970#bib.bib12) 和层级归属预测6 (https://arxiv.org/html/2608.10970#bib.bib13)。由于其广泛的参数化知识和强大的生成能力,LLM 能够在零样本设置下推断层级关系并提出语义相关的概念,这使得它们在扩展现有分类法方面具有吸引力,尤其是在策展资源稀缺或快速演变的领域。然而,如果没有明确的结构验证,LLM 生成的概念可能违反分类法层级,且此类错误可能在递归扩展过程中累积。
为应对这些挑战,我们提出了 ReLTEx11 源代码和基准划分可在 https://github.com/zeinabGhamlouch/ReLTEx 获取。,一个基于LLM的可靠分类法扩展框架。ReLTEx 将零样本的基于LLM的候选生成与结构感知验证和递归扩展控制相结合。候选的父子关系通过一个在分类法结构上训练的路径感知分类器进行验证,从而在结构不一致的生成结果被插入分类法之前将其过滤。递归停止标准进一步规范递归扩展,并减少错误生成的传播。
我们在掩蔽分类法扩展设置下,使用基准分类法评估了 ReLTEx,其中隐藏的概念必须从部分分类法中恢复。我们的评估包括标准及调整后的评估指标、人工评估、基于LLM的评估以及消融研究。本工作的主要贡献如下,我们提出:
- •一个零样本的基于LLM的分类法扩展框架,利用分类法层级中的上下文信息生成候选概念。
- •一种结构感知验证机制,减轻幻觉和结构不一致的父子关系,提高递归分类法扩展的可靠性。
- •一个全面的评估协议,基于调整后的评估指标、人工评估和基于LLM的评估。
本文组织如下。第2节 (https://arxiv.org/html/2608.10970#S2) 回顾相关工作,而第3节 (https://arxiv.org/html/2608.10970#S3) 定义了分类法扩展问题。第4节 (https://arxiv.org/html/2608.10970#S4) 介绍 ReLTEx。第5节 (https://arxiv.org/html/2608.10970#S5) 描述数据集和评估指标,第6节 (https://arxiv.org/html/2608.10970#S6) 给出实验结果。最后,第7节 (https://arxiv.org/html/2608.10970#S7) 总结全文。
## 2 相关工作
近期方法将分类法扩展表述为*节点归属问题*,即通过预测预定义候选概念的最合适父节点,将其插入现有分类法。下面我们将这些方法分为基于结构的方法和基于LLM的方法。
#### 基于结构的方法。
TaxoExpan11 (https://arxiv.org/html/2608.10970#bib.bib2) 利用图神经网络和自监督学习,通过自我图表示插入未见概念。在利用结构信息的基础上,TEMP4 (https://arxiv.org/html/2608.10970#bib.bib9) 使用 PLM 对分类法路径进行建模,并在正负插入路径上优化动态边际排序目标。STEAM17 (https://arxiv.org/html/2608.10970#bib.bib3) 采用多视图协同训练框架,通过迷你路径结构结合分布式、上下文和词汇句法表示。其他方法同样侧重于通过基于图的表示10 (https://arxiv.org/html/2608.10970#bib.bib17)、对比学习策略8 (https://arxiv.org/html/2608.10970#bib.bib18) 或 PLM 嵌入14 (https://arxiv.org/html/2608.10970#bib.bib19) 来改进层级归属。
尽管这些方法有效,现有的大多数分类法扩展方法11 (https://arxiv.org/html/2608.10970#bib.bib2);5 (https://arxiv.org/html/2608.10970#bib.bib10) 在一种受限设置下运行,即候选概念是预先提供的,而不是动态生成全新的概念。
#### 基于LLM的方法。
TaxoGlimpse13 (https://arxiv.org/html/2608.10970#bib.bib11) 评估了 LLM 在通用和专门分类法中编码的分类学知识。结果表明,LLM 的性能在专业领域和更深的分类法层级上会下降。然而,他们的工作侧重于评估分类学知识,而非扩展现有层级。Chain\-of\-Layer18 (https://arxiv.org/html/2608.10970#bib.bib12) 通过逐层提示和基于集成的关系过滤机制,从给定实体集合迭代归纳分类法。FLAME6 (https://arxiv.org/html/2608.10970#bib.bib13) 利用 LLM 为预先已知的查询概念预测最合适的父节点。
Taxoria2 (https://arxiv.org/html/2608.10970#bib.bib1) 是与我们工作最接近的,因为它基于现有分类法递归生成新概念,而不依赖预定义的候选池。然而,其验证主要基于嵌入的语义相似性,并未显式建模生成父子关系的结构兼容性。因此,错误或弱相关的生成结果可能被接受并在递归扩展中传播。
与以往的分类法扩展方法不同,以往方法要么归附预定义概念,要么主要依赖语义相似性,ReLTEx 则将开放式 LLM 生成与路径感知结构验证及递归扩展控制相结合。通过在插入前于其层级上下文中验证每个生成的父子关系。
## 3 问题形式化
分类法可以表示为 T=\(V,E\),其中 V 表示概念(节点)集合,E 表示概念之间的父子关系。给定一个初始种子分类法 T\_\{0\}=\(V\_\{0\},E\_\{0\}\),分类法扩展的目标是在保持层级一致性的同时,用语义相关的概念丰富分类法。形式上,给定一个节点 v∈V\_\{0\} 及其局部层级上下文,目标是生成一组候选子概念 C\_\{v\}=\{c\_\{1\},c\_\{2\},\ldots,c\_\{k\}\}。其中 k 表示为节点 v 生成的候选子概念数量,而 c\_\{i\} 是 v 的一个潜在子概念,其中 i=1,\ldots,k。
生成的候选可能包含幻觉、冗余或结构不一致的内容。因此,目标是选择适合安全集成到分类法中的精选子集。因此,扩展后的概念集可表示为 V^\{\prime\}=V\_\{0\}\cup A\_\{v\};其中 A\_\{v\}\subseteq C\_\{v\} 表示选择插入分类法的生成候选子集。
## 4 ReLTEx
图1 (https://arxiv.org/html/2608.10970#S4.F1) 展示了 ReLTEx 框架的概览。从种子分类法开始,ReLTEx 分三个阶段扩展每个分类法节点:\(A\) 基于LLM的候选生成,\(B\) 结构感知验证,以及 \(C\) 使用停止机制的递归扩展。以下小节详细描述每个阶段。
参考图注 图 1:ReLTEx 框架概览。
### 4\.1 基于LLM的候选生成
ReLTEx 通过分类法的深度优先遍历执行递归分类法扩展。对于每个目标节点,该框架使用其局部层级上下文构建提示,该上下文包括从分类法根节点到目标节点的路径及其现有子节点。祖先路径提供了当前分类法分支的语义上下文,而现有子节点则展示了所需的抽象层级,引导 LLM 生成适当粒度级别的语义相关子概念。语言模型被指示以适当的粒度级别生成新的子概念,同时避免重复、同义词以及现有或新生成的兄弟节点的简单改写(附录E (https://arxiv.org/html/2608.10970#A5) 显示了提示)。对于每个父节点,LLM 被要求生成固定数量 k 的候选子概念。参数 k 控制扩展分类法的分支因子,并可根据所需扩展程度进行调整。生成后,候选名称经过基本的词汇规范化。在此规范表示下的精确词汇重复项,以及与现有子节点或兄弟节点匹配的候选,将在其余候选进入验证阶段之前被移除。
### 4\.2 结构感知候选验证
我们研究了三种验证策略:\(i\) 语义相似性过滤,测量生成概念与其局部分类法上下文之间的语义兼容性;\(ii\) 基于LLM的验证,由 LLM 判断生成概念是否是父节点的有效、非冗余子节点;以及 \(iii\) 分类器引导的验证,利用在分类法边上训练的分类器预测父子关系的结构有效性。本小节我们重点关注分类器引导的验证。
与语义相似性度量不同,所提出的分类器通过联合考虑层级上下文、父概念和生成的子概念,从标注的分类法关系中学习结构兼容性。验证模块被表述为二元分类任务,使用在标注的父子关系对上微调的 DistilRoBERTa 编码器。分类器在源自种子分类法的正负例上进行训练,使其能够区分有效和无效的层级关系。给定层级路径 p、父概念 v 和生成的候选子概念 c\_\{i\},表示为 Path [SEP] Parent [SEP] Child,分类器输出置信度分数 s\(p,v,c\_\{i\}\)∈\[0,1\],定义为分配给正类的 softmax 概率,表示关系 \(v,c\_\{i\}\) 在层级上下文 p 内对应有效分类法边的可能性。候选概念满足 s\(p,v,c\_\{i\}\)≥τ(其中 τ 为验证阈值)则被接受并纳入分类法;否则将被丢弃。
正例对应于有效的分类法边,而负例则通过产生语义上合理但结构上错误关系的层级感知扰动自动生成。我们构造以下难负例:
- •反转边,通过反转有效的父子关系获得,例如,Comment→Answer 变为 Answer→Comment(见图1 (https://arxiv.org/html/2608.10970#S4.F1) 中的运行示例)。
- •兄弟混淆,将正确的父节点替换为其兄弟节点之一,例如,Comment→Answer 变为 Book→Answer。
- •祖父-子混淆,将直接父节点替换为其父节点,例如,Comment→Answer 变为 CreativeWork→Answer。
- •同深度错配,将子节点附加到与其真实父节点处于相同层级的概念上,例如,Article→Answer。
- •邻近层级混淆,将正确的父节点替换为来自邻近分支的语义相关概念,例如,Review→Answer。
- •随机无效关系,通过随机配对不相关的概念获得,例如,Organization→Answer。
每个训练实例表示为 Path [SEP] Parent [SEP] Child,其中路径对应于从分类法根节点到父节点的祖先序列。通过在正例和层级感知的难负例上训练,分类器学习结构兼容性,而非仅依赖语义相似性。
### 4\.3 递归扩展
递归生成扩展可能逐渐引入语义漂移和不受控制的分类法增长。例如,一旦错误的父子关系被接受,随后的扩展可能会继续从该错误节点出发,生成越来越偏离预期分类法分支的概念。为缓解此问题,ReLTEx 复用置信度分数相似文章
推理者还是翻译者?税法中的污染感知评估与神经符号鲁棒性
本文实证研究了LLMs在税法中的法律推理,表明数据污染会夸大性能,而神经符号混合系统比单体LLMs提供更可靠和稳健的泛化能力。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
LC-ERD:通过一致性规约的奖励分解挖掘潜在逻辑实现自我进化推理
LC-ERD是一个框架,从LLM生成的推理链中挖掘潜在逻辑,将全局奖励分解为步骤级信号,实现无需人工标注的自我进化推理。它通过变分逻辑势和多智能体值分解来解决标签噪声、粗粒度监督和分布崩溃问题。
LaTER:通过潜在探索与显式验证实现高效的测试时推理
本文介绍了 LaTER,一种两阶段推理范式,它将潜在探索与显式思维链(Chain-of-Thought)验证相结合,从而在保持准确率的同时,降低大型语言模型的标记使用量并提升效率。
超越置信度:面向LLM推理的稳定性感知测试时自适应
本文提出TASCO,一个用于LLMs测试时自适应的框架,它将局部稳定性融入基于置信度的优化中,以提高推理准确性和令牌效率,同时无需更新模型参数。