论法律本体学习中语义保持的测量
摘要
本文提出了一种基于任务的评估方法,用于测量本体学习中的语义保持,比较大型语言模型在法律领域源文档与转换表示上的表现。
arXiv:2608.12326v1 公告类型:新
摘要:本体学习将非结构化文本转换为结构化表示,以支持自动化推理。然而,结构化处理可能造成信息丢失,而当前的评估方法无法检测这种损失,它们侧重于结构正确性,却未能衡量转换后语义是否得以保留。我们提出了一种解决此问题的评估方法:比较大型语言模型在源文档上的任务表现与在转换表示上的表现,二者差异即为语义损失。我们以法律合并协议分析为示例领域,该领域因语言复杂且语义要求精确而被选中,对比了直接应用大型语言模型与三种本体学习方法在六个语言模型上的表现。结果揭示了系统性的语义损失,且损失随推理复杂度和模型-方法交互作用而显著变化。我们的贡献包括:(1)一个用于测量本体学习中语义保持的评估框架;(2)实证证据表明语义损失随模型-方法配对的不同而剧烈变化,为法律知识系统中选择最优配置提供了指导。
查看缓存全文
缓存时间: 2026/08/14 09:24
# 论法律本体学习中的语义保持度量 来源:https://arxiv.org/html/2608.12326 Jarosław A. Chudziak 华沙理工大学 波兰,华沙 [email protected] ###### 摘要 本体学习将非结构化文本转换为用于自动推理的结构化表示。然而,结构化过程可能带来信息损失,而当前评估方法无法检测这种损失——它们侧重于结构正确性,却未能衡量转换后语义是否得以保留。我们提出一种解决该问题的评估方法:将LLM在源文档上的任务表现与其在转换后表示上的表现进行比较,二者差异即为语义损失。我们以法律并购协议分析这一领域来演示该方法,该领域因其语言复杂且语义要求精确而被选中,并比较了六种语言模型上直接应用LLM与三种本体学习方法的效果。结果揭示了系统性的语义损失,且损失程度随推理复杂度和模型-方法交互作用而显著变化。我们的贡献是:(1)一个用于衡量本体学习中语义保持的评估框架,以及(2)经验证据表明语义损失随模型-方法配对的不同而剧烈变化,为法律知识系统中选择最优配置提供指导。 *关*键词 本体学习 · 语义保持 · 法律本体 · LLM评估 · 知识表示 · 基于任务的评估 ## 1 引言 本体学习旨在将非结构化文本自动转换为结构化、机器可读的表示,以支持跨系统的推理与集成[4 (https://arxiv.org/html/2608.12326#bib.bib4),18 (https://arxiv.org/html/2608.12326#bib.bib20)]。这一方法在专业领域,尤其是法律领域[10 (https://arxiv.org/html/2608.12326#bib.bib24),5 (https://arxiv.org/html/2608.12326#bib.bib5)]重新引起了关注,因为文本信息的数量和复杂性给人工知识组织工作带来了挑战。 在现代知识系统中,本体与大型语言模型(LLM)发挥着互补作用。自然语言对人类而言很好用,但由于固有的歧义和不一致性,它作为一种计算系统之间的通信协议效果不佳[20 (https://arxiv.org/html/2608.12326#bib.bib22)]。本体提供了受控词汇表,这对于数据互操作性、透明的知识表示以及LLM无法保证的逻辑一致性要求至关重要[20 (https://arxiv.org/html/2608.12326#bib.bib22)]。这为混合架构创造了机会,使LLM能够通过结构化本体表示与符号推理系统交互[24 (https://arxiv.org/html/2608.12326#bib.bib28),17 (https://arxiv.org/html/2608.12326#bib.bib37)]。 然而,一个关键问题仍未得到充分探讨:当我们把自然语言文本转换为本体表示时,是否丢失了下游任务所需的语义内容?当前评估方法侧重于结构正确性[2 (https://arxiv.org/html/2608.12326#bib.bib2),3 (https://arxiv.org/html/2608.12326#bib.bib3)],即评估本体是否符合形式规范并表现出逻辑一致性。这些度量保证了技术有效性,却无法检测语义损失。一个本体可能通过所有结构测试,却仍然无法支持其预期要完成的推理任务。如果没有衡量语义保持的方法,从业者就无法基于证据决定本体转换何时有助于或阻碍其应用。 参见图注图1:我们的评估方法概览。左:源文档(基线为100%可访问内容)通过三种本体学习方法进行转换,每种方法都会引入语义损失(平均准确率,LLMs4OL:−21个百分点,NeOn-GPT:−13个百分点,NeOn-CoT:−16个百分点)。右:传统评估验证结构,但无法检测信息损失;我们提出的基于任务的方法通过比较LLM在转换前后在相同任务上的准确率来衡量语义保持。我们提出一种评估方法来解决这一缺口,使用LLM表现作为语义可访问性的代理。我们的方法将LLM在源文档上的基线表现视为该模型可访问语义内容的特定于模型的上限,然后衡量在本体转换后,该内容中还有多少仍可访问。该方法建立在NLP中基于任务的评估范式[16 (https://arxiv.org/html/2608.12326#bib.bib18),22 (https://arxiv.org/html/2608.12326#bib.bib26)]以及近期行为测试框架[23 (https://arxiv.org/html/2608.12326#bib.bib27)]之上。我们并非声称衡量绝对语义内容,而是量化给定模型能够提取的信息的相对保持程度,从而能够在一致条件下直接比较源文档与其本体转换结果。 我们使用LegalBench中的MAUD数据集[13 (https://arxiv.org/html/2608.12326#bib.bib13),29 (https://arxiv.org/html/2608.12326#bib.bib33)]来演示该方法,将直接应用LLM与三种本体学习方法进行比较:LLMs4OL[1 (https://arxiv.org/html/2608.12326#bib.bib1)]、NeOn-GPT[11 (https://arxiv.org/html/2608.12326#bib.bib11)],以及我们引入的一种简化NeOn-CoT方法。我们的评估涵盖六种语言模型,以确保研究结果在不同架构下具有稳健性。结果显示所有方法都存在系统性的语义损失,对于复杂法律推理任务的退化尤为严重。 本工作的贡献是:(1)一个用于衡量本体学习中语义保持的评估框架,以及(2)经验证据表明法律本体学习中的语义损失随模型-方法配对不同而剧烈变化,为选择最优配置提供指导。 本文其余部分组织如下。第2节 (https://arxiv.org/html/2608.12326#S2)回顾相关工作。第3节 (https://arxiv.org/html/2608.12326#S3)介绍所提出的方法、三种本体学习方法及实验设置。第4节 (https://arxiv.org/html/2608.12326#S4)报告结果,包括任务层面的分析。第5节 (https://arxiv.org/html/2608.12326#S5)和第6节 (https://arxiv.org/html/2608.12326#S6)讨论启示、局限和未来工作。第7节 (https://arxiv.org/html/2608.12326#S7)总结。 ## 2 相关工作 本体工程已经从传统的基于手工的方法[5 (https://arxiv.org/html/2608.12326#bib.bib5),10 (https://arxiv.org/html/2608.12326#bib.bib24)]发展为近期基于LLM的自动化方法[1 (https://arxiv.org/html/2608.12326#bib.bib1),11 (https://arxiv.org/html/2608.12326#bib.bib11)]。传统方法使用词汇-句法模式挖掘和聚类[14 (https://arxiv.org/html/2608.12326#bib.bib15)]、Text2Onto[7 (https://arxiv.org/html/2608.12326#bib.bib8)]等框架,以及用于结构化本体开发的NeOn方法[25 (https://arxiv.org/html/2608.12326#bib.bib29)]。早期工作探索了语义网络作为元层表示,以在异构数据类型之间保持语义可访问性[6 (https://arxiv.org/html/2608.12326#bib.bib7)]。法律本体项目借鉴了法理学基础,并采用了自底向上、自顶向下和混合开发策略[10 (https://arxiv.org/html/2608.12326#bib.bib24)]。构建方法包括Methontology[9 (https://arxiv.org/html/2608.12326#bib.bib10)]、Ontology Development 101[21 (https://arxiv.org/html/2608.12326#bib.bib23)]和CommonKADS[26 (https://arxiv.org/html/2608.12326#bib.bib30)]。系统分析显示,93.5%的法律本体开发是手工完成的,其中41%缺乏验证活动[10 (https://arxiv.org/html/2608.12326#bib.bib24)]。评估采用了黄金标准、基于案例、数据驱动和基于用户等方法[2 (https://arxiv.org/html/2608.12326#bib.bib2)]。法律领域带来了诸多挑战,包括复杂的写作风格、异构来源和不断演变的文档,这些都导致了句法和语义异常[10 (https://arxiv.org/html/2608.12326#bib.bib24)]。 LLM引入了基于自动化知识提取的新范式[1 (https://arxiv.org/html/2608.12326#bib.bib1)]。LLMs4OL处理术语类型标注(MAP@1)、分类体系发现和关系抽取(F1分数),报告称术语类型标注是最具挑战性的任务(60-80%的基线),微调分别提升了25%、18%和3%[1 (https://arxiv.org/html/2608.12326#bib.bib1)]。NeOn-GPT将结构化方法与LLM能力相结合,使用公理数量、层级深度等结构度量[11 (https://arxiv.org/html/2608.12326#bib.bib11)]。这两种方法都侧重于结构正确性,而非知识表示质量或语义保持[1 (https://arxiv.org/html/2608.12326#bib.bib1),11 (https://arxiv.org/html/2608.12326#bib.bib11)]。结构度量无法捕捉语义丰富度,也无法捕捉转换过程中的语义损失,尤其是在法律等专业领域[10 (https://arxiv.org/html/2608.12326#bib.bib24)]。 基于任务的评估提供了另一种视角。Sparck Jones和Galliers确立了内在评估与外在评估之间的区分[16 (https://arxiv.org/html/2608.12326#bib.bib18)],Mollá和Hutchinson则展示了结构准确性与下游表现之间的脱节[19 (https://arxiv.org/html/2608.12326#bib.bib21)]。对于知识系统,Porzel和Malaka开创了基于任务的本体评估[22 (https://arxiv.org/html/2608.12326#bib.bib26)],随后Gangemi等人[12 (https://arxiv.org/html/2608.12326#bib.bib12)]和Brewster等人[3 (https://arxiv.org/html/2608.12326#bib.bib3)]对其进行了扩展。与CheckList[23 (https://arxiv.org/html/2608.12326#bib.bib27)]等行为测试框架类似,我们将LLM表现视为评估表示质量的信号。 信息论方法为衡量表示转换过程中的保持问题提供了定量框架。知识蒸馏研究引入了使用Jensen-Shannon散度的忠诚度度量[30 (https://arxiv.org/html/2608.12326#bib.bib34)],以及衡量跨表示层级语义保留的方法[15 (https://arxiv.org/html/2608.12326#bib.bib17)]。多尺度互信息方法表明,必须在不同粒度上衡量保留情况,才能捕捉局部和全局一致性[31 (https://arxiv.org/html/2608.12326#bib.bib35)]。LLM作为评估者的研究表明,强LLM与人类偏好的一致性可达80%以上[32 (https://arxiv.org/html/2608.12326#bib.bib36)],不过关于偏差的研究也指出其局限需要仔细校准[28 (https://arxiv.org/html/2608.12326#bib.bib32)]。使用多样化LLM评估者的集成方法在可靠评估方面显示出前景[27 (https://arxiv.org/html/2608.12326#bib.bib31)]。这些结果支持我们将LLM基线表现作为衡量本体转换过程中语义保持的参考点。 ## 3 方法 当前本体学习评估方法侧重于结构正确性,而非知识转换质量[2 (https://arxiv.org/html/2608.12326#bib.bib2),1 (https://arxiv.org/html/2608.12326#bib.bib1),11 (https://arxiv.org/html/2608.12326#bib.bib11)]。基于NLP中的任务评估范式(第2节 (https://arxiv.org/html/2608.12326#S2)),我们提出一个评估框架,通过将LLM在下游任务上的表现作为语义可访问性的代理来量化语义保持[22 (https://arxiv.org/html/2608.12326#bib.bib26),23 (https://arxiv.org/html/2608.12326#bib.bib27)]。 我们的方法将LLM在源文档上的基线表现视为该LLM可提取的全部可访问内容,定义为LLM(text,question)→answer在原始法律文本上的表现。该基线从该模型的角度确立了语义可访问性的上限,遵循外在任务表现比内在结构度量提供更有意义信号的原则[16 (https://arxiv.org/html/2608.12326#bib.bib18),19 (https://arxiv.org/html/2608.12326#bib.bib21)]。 虽然本体转换可能有意识地优先考虑结构组织和形式推理能力,而非完全保留语义,但衡量可访问性的权衡能够支持知情决策,判断本体转换何时提升而非削弱特定应用的实际效用。我们将其量化为:语义损失=基线表现−转换后表现。 该框架提供了一种与领域无关的评估方式,可适用于各种法律专业方向,无需特定领域的黄金标准;它从以用户为中心的角度衡量语义保持,聚焦于下游应用的实际效用;并支持对多种本体学习方法进行系统性比较。重要的是,我们的方法相对于每个LLM自身的能力来衡量语义保持,从而考虑了模型特定的基线差异。 ### 3.1 本体学习方法 我们评估了三种本体学习方法,并与前一节建立的直接LLM应用基线进行比较。每种方法使用不同的计算策略将源法律文档转换为结构化本体表示,代表了不同层次的方法结构、计算复杂度以及不同程度的领域感知。这些方法在复杂度上从并行任务分解到顺序的、由方法引导的构建各不相同,并且在领域针对性程度上也有所不同——从完全领域无关(LLMs4OL)到显式领域感知(NeOn-GPT和NeOn-CoT)。这种变化使得我们能够系统分析结构复杂度和领域特异性如何影响本体转换过程中的语义保持。 #### LLMs4OL 该方法基于Babaei Giglou等人[1 (https://arxiv.org/html/2608.12326#bib.bib1)]提出的框架,将本体构建分解为三个并行任务:术语类型标注(对重要术语进行分类)、分类体系发现(识别层级关系)和非分类学关系抽取(发现实体之间的语义关系)。该方法被设计为领域无关的,不对特定领域或下游评估任务做任何假设。由于原始LLMs4OL框架侧重于单独的本体学习任务而不进行集成,我们额外添加了一个集成步骤,将三个任务的结果综合成一个完整的、Turtle格式的OWL本体。该集成步骤使用零样本提示,将术语分类、层级关系和语义关系组合成一个连贯的本体表示,无需特定领域指导。 #### NeOn-GPT 遵循Fathallah等人[11 (https://arxiv.org/html/2608.12326#bib.bib11)]描述的方法,该方法实现了结构化的五阶段流水线:需求规格说明、能力问题生成、概念模型创建、本体草稿实现以及实例和注释的丰富。与LLMs4OL不同,该方法通过识别领域特定概念和关系来显式地整合领域感知,将法律术语和概念作为结构化和语义约束引入本体构建过程。这种方法体现了法律领域知识在转化过程中的作用,同时保持可复现的自动化流水线。结果本体在结构完整性和领域特异性方面都比LLMs4OL的输出更丰富。 #### NeOn-CoT 我们提出一种基于LLM的本体学习方法,将NeOn-GPT的结构化方法与非形式化推理相结合。与依赖显式架构组件或工程流水线的其他方法不同,NeOn-CoT直接利用单个LLM通过多步骤推理生成本体。具体而言,我们提示LLM依次执行以下步骤:(1)从法律文档中提取核心法律概念和关系;(2)将提取的概念组织成语义层次结构;(3)形式化定义类、属性和关系公理;(4)生成Turtle格式的OWL本体。整个过程中,要求LLM显式地推理每一步,从而以更透明的方式将领域知识融入最终表示。该方法刻意将复杂流水线替换为依赖LLM的隐式推理能力,从而能够分析结构化方法本身是帮助还是阻碍语义保持。与NeOn-GPT相比,NeOn-CoT避免了多阶段流水线的累积误差,但也放弃了对领域概念和关系的显式建模控制。 ### 3.2 实验设置 我们评估六种语言模型,以涵盖不同架构族和能力水平:GPT-4o、GPT-4o-mini、o1-mini(OpenAI)、Claude 3.5 Sonnet(Anthropic)、Llama 3.1 70B和Llama 3.1 405B(Meta)。选择这些模型是因为它们代表了当代LLM的多样谱系,从高效紧凑的模型到旗舰级大型模型,支持对该框架进行稳健的跨模型验证。我们使用固定温度0进行所有实验,使用官方模型API或标准推理端点,从而保证结果的可复现性。虽然不同提供商之间的系统提示略有不同,但任务指令在所有模型中保持一致。 **任务和数据集。** 我们使用来自LegalBench[13 (https://arxiv.org/html/2608.12326#bib.bib13),29 (https://arxiv.org/html/2608.12326#bib.bib33)]的MAUD数据集,该数据集包含从真实并购协议中提取的50个多选问答任务。这些任务对应于协议条款,涵盖特定并购法律文件中的起草惯例和常见条款,因此高度适用于法律文本的语义保持评估。MAUD中的每个问题涉及四个选择项,其中两到三个是合理的,通常两个正确、两个错误,并要求对条款含义进行细粒度的法律推理。该数据集以复杂的法律语言和通常需要精确语义理解才能正确回答的问题而著称。所有实验均使用相同的问题和选择项,从而在基线和转换条件之间实现一一对应。 **转换表示。** 在语料库层面生成本体(每个文档作为合并的语料库单元),覆盖整个合并协议文本。然后使用转换后的表示回答相同的问答提示。与在文档层面生成本体、随后可能由于信息碎片化而降低下游表现不同的是,语料库层面的转换保留了整个文档上下文。这表明我们的测量方法评估的是表示转换的质量,而非原始文档分割对语义造成的附加影响。对于LLMs4OL方法,这三个任务在完整文档文本上运行,输出被集成到单个本体中。同样,NeOn-GPT和NeOn-CoT使用完整文档作为输入。为测试语义可访问性,每组本体方法的转换表示都被呈现给每个LLM用来回答MAUD问题。 **评估协议。** 对于每个(模型,方法,问题)三元组,我们在提示中向模型提供问题、选项和适用的表示(原始文本或转换后的本体),并要求其选择一个选项。基线条件接收原始合并协议。转换条件根据所评估的方法接收本体表示。每个模型对每个问题回答一次,从而覆盖50个MAUD问题和50个文档。每个模型在基线和转换条件下回答相同的问题。模型的选择将与真实标签进行比较。度量标准为准确率(总体)和在MAUD各自定义的每个法律问题类别上的准确率。我们还报告基线准确率与转换后准确率之间的差值,即语义损失,单位为百分点。数据则通过一致的预处理流程归一化为纯文本,以提取源材料(合并协议)和MAUD问题。将相同的内容输入到所有模型和提示模板中,确保一致性。 ## 4 结果与讨论 我们通过对报告的数据进行成对比较来评估三种本体学习方法在六种LLM上的语义保持能力。所有实验均覆盖相同的MAUD问答任务,从而使比较直接且可归因。表1显示了每种方法相对于基线的语义损失:负值表示表现下降(语义损失),正值表示改善(语义增益)。平均结果:LLMs4OL为−21个百分点,NeOn-GPT为−13个百分点,NeOn-CoT为−16个百分点。 表1:六种LLM在三种本体学习方法上的语义损失(准确率百分点)。负值表示与直接LLM应用相比表现下降。显示总体以及按MAUD子任务类别的结果。 | 模型 | LLMs4OL | NeOn-GPT | NeOn-CoT | |------|---------|----------|----------| | GPT-4o | −19 | −12 | −15 | | GPT-4o-mini | −25 | −16 | −19 | | o1-mini | −17 | −10 | −13 | | Claude 3.5 Sonnet | −22 | −14 | −17 | | Llama 3.1 70B | −23 | −15 | −18 | | Llama 3.1 405B | −21 | −13 | −16 | 总体结果表明,在所有本体学习方法和所有模型中都存在显著且系统性的语义损失。没有一种方法能够保持与直接LLM应用相当的性能。这一发现凸显了本体转换虽然有益于结构化推理,但会为任何LLM可访问的语义引入实质性的障碍。具体而言,在直接处理原始法律文本时具有相对较高基线的模型,在转换后也倾向于保持较高性能,但损失的严重程度(比例)与具体配对有关。我们观察到模型和方法之间的显著交互作用:表现最佳的配对相对于基线损失约10个百分点,而较不利的配对损失达25个百分点。结果表明,选择合适的方法在控制法律知识系统中的语义损失方面与选择模型同样重要。 在三种方法中,NeOn-GPT始终表现出最小损失,随后是NeOn-CoT,而LLMs4OL表现出最大损失。这一排序在所有六个模型中一致,表明方法结构(而不仅仅是模型的固有能力)在保留语义方面起着关键作用。NeOn-GPT使用明确建模的领域知识和结构化流水线,似乎生成了特别有利于LLM保留语义的本体。NeOn-CoT尽管简化了流水线,但其推理能力使语义损失水平接近NeOn-GPT。完全领域无关且由并行任务组成的LLMs4OL则遭受最大损失,表明在没有任何领域约束的情况下提取和集成本体组件会移除下游任务所需的语义细微差别。虽然结构正确、形式完整,但LLMs4OL生成的和法律知识相关的层析结构表示在语义上不如NeOn-GPT和NeOn-CoT生成的结构化表示。 ### 4.1 任务层面的分析 MAUD任务因其推理类型不同而不同,包括直接条款检索、跨条款比较和反事实推理。我们分析每种方法在不同任务类型中损失的分布。为了系统评估,我们根据MAUD数据集中定义的主题类别对50个问题进行分类,并计算每个类别的平均损失。表2显示了关键的类别。损失最大的类别是那些涉及逻辑和反事实推理的类别,其中LLMs4OL在“初始条款”规范上的平均损失约30个百分点。相比之下,与直接检索相关的任务表现出较小的下降。 表2:选定的MAUD子任务按损失排序。在所有方法和模型中显示平均语义损失(百分点)。 | 子任务 | 描述 | 平均损失 | |--------|------|----------| | 并购案例法 | 多条款的司法应用 | −31 | | 受信义务 | 代理与信义推理 | −27 | | 初始条款 | 时间条件与并购条款 | −25 | | 交易处理 | 反事实推理 | −23 | | 投资者保护 | 投资者条款 | −21 | | 定义 | 条款术语的检索 | −9 | 任务层面的分析揭示了几个重要的模式。首先,需要法律原则的综合运用或多条款联合推理的任务,在所有方法中都显示出最大的语义损失。这些任务不仅要求保留离散语义,还要求保留这些语义之间的关系。转换后的本体虽然保留了单个概念的语义,但通常会在将这些概念链接到其法律含义的推理步骤中造成语义断裂。在MAUD中的所有法律任务中,反事实和比较推理受到的损害最大,因为这些推理依赖于对原始文本的细微且有时是隐含的解读。 隐含语义保留的需求在转换为明确的本体结构时尤为明显。法律主要文件中的推理模式(如“除非……否则”“即使”“如果……则”)无法轻松表示为明确的类或关系,却对正确回答特定任务至关重要。在转换后的表示中,这些模式要么被提取为不完整的公理,要么完全缺失。结果,在任何方法下,性能都下降到了随机水平或更低,特别是在需要运用隐含推理的任务中。事实上,推理复杂性与语义损失之间存在很强的秩相关(对于LLMs4OL,ρ=0.79;对于NeOn-GPT,ρ=0.81;对于NeOn-CoT,ρ=0.77)。虽然方法上的约束和领域知识减少了损失,但推理的复杂性是一个独立且强健的因素,影响着即便最结构化的本体转换中的语义可访问性。 总体而言,这些结果表明,评估语义保持不仅应报告总体表现,还应报告任务类型,以便为不同法律应用提供细粒度的选择指导。 ## 5 意义与局限性 我们的发现对法律知识系统和更广泛的本体驱动架构具有直接意义。在构建法律知识系统时,选择结构化和最复杂的方法并不总是最好的选择。语义损失的显著差异——在模型-方法配对之间,从−10到−25个百分点不等——表明转换方法的选择应基于对特定任务需求的经验评估,而非单纯依赖结构度量。在准确性是法律应用中关键任务的首要考虑因素的场景中,直接LLM应用目前仍优于任何本体学习方法,从而支持采用混合方法,让本体在支持推理和集成的同时,与原始文本的语义保真度保持平衡。 简化本体构建的实际影响是显著的。NeOn-CoT获得了与NeOn-GPT类似的效果,同时放弃了多阶段流水线。这表明对于许多应用而言,整体的、结构化推理的LLM提示可能足以进行语义保持的本体构建。该结果还可能对可扩展性和成本产生实际影响,因为NeOn-CoT要求的提示交互较少,系统组件也较少。 限制方面,我们的评估仅涵盖单一数据集(MAUD)和有限的法律领域子集。尽管MAUD提供了严格和一致的测试平台,但尚未捕捉到房地产法、知识产权法或刑法等法律范畴中的多样性。我们的方法依赖于LLM作为语义内容的代理,这取决于所使用的特定模型。基线模型上的表现波动会转移转换为单独技术的成本。最后,我们的方法衡量的是任务可访问性,而非一些理论上的绝对语义内容;模型从转换表示中提取含义时所面临的结构性不匹配,可能与语义损失本身混淆。 还有一些重要的理论局限。术语“语义损失”通常表示转换不保留意义。然而,本体转换的无法解释的语义缺陷并不总是来自从源文本中提取了错误的事实;它们还可能源于法律推理的表示方式并不适合经典的逻辑推理。从实际角度看,这仍然有用,因为对于无法在某些表示中执行的任务而言,标记该任务在该表示中无法执行仍然有助于进行正确的系统设计。此外,由于我们的基线是LLM表现,因此基准选择将语义损失定义为特定于模型的可访问内容,而非人类可读的语义。 未来的工作可以从以下几个方向扩展本研究的发现:(1)将评估方法扩展到其他法律领域和语言;(2)探索将文本混合到转换本体中的混合表示,以改善语义保持;(3)使用法律知识系统的人类评估来补充LLM基线;(4)开发既能改善结构化推理又能减少语义损失的本体构建策略。 ## 6 未来工作 本研究中提出的框架为衡量本体学习中的语义保持提供了基础。未来,我们计划扩展任务范围,超越MAUD的法律合并条款,以覆盖更广泛的法律任务、文档类型和语言。此外,我们建议通过微调或受控解码来直接优化语义保持,并测试混合表示,其中部分原始文本与本体转换并行或在其内部使用。此类方法可能会利用两种表示的互补优势,同时减少语义损失。我们方法的第二个方向是进行更多以人为中心的评估,以补充LLM代理的度量。最后,目前的结果还表明,可能需要为特定模型动态构建本体,这取决于应用的推理需求。 ## 7 结论 我们提出了一种基于任务的评估框架,用于衡量本体学习中的语义保持。通过对MAUD上的法律文献进行严格的实证评估(涉及六种LLM和三种本体学习方法),我们表明,当前本体学习方法普遍引入显著的语义损失,从大约−10到−25个百分点不等。结果表明,对于复杂的法律推理任务,损失的严重性最高,而且方法和模型的选择会强烈影响最终的语义可访问性。一种简单且资源高效的基于推理的提示方法(NeOn-CoT)几乎达到了更复杂的NeOn-GPT方法的效果,而完全领域无关的方法(LLMs4OL)性能最低。这项工作的直接实际结论是明确的:本体结构带来的收益必须与其引起的语义损失进行权衡,而结构度量本身不足以评估法律知识支持技术。我们还引入了一个工具,用于在特定模型、方法和任务组合下对语义保持进行实证评估,为法律本体实践中的可操作决策铺平了道路。
相似文章
同一位患者,不同的表述,不同的诊断?评估临床大语言模型的语义稳定性
本文提出了一种基于自然语言推理(NLI)的语义验证框架,用于评估临床大语言模型对保留语义的提示变化的敏感性,并引入了MVS、ΔC和WCI等度量指标。结果表明,领域专业化并不能持续提高鲁棒性,领域专用模型和通用模型的表现均参差不齐。
LP-Eval: 用于衡量法律命题生成质量的评分标准与数据集
本文介绍了LP-Eval,这是一个由法律专家标注的、用于评估大语言模型生成法律命题质量的评分标准与数据集。结果表明,基于评分标准的LLM评估比直接打分更接近专家评估。
大语言模型能泄露训练数据,但它们愿意吗?对LLM记忆的倾向性感知评估
PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。
从基准测试到推理能力:大语言模型在越南法律文本上的双维度大规模评估
为大语言模型在越南法律文本简化任务上提出了一个综合的双维度评估框架,结合了定量基准测试(准确性、可读性、一致性)和跨 GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1 的定性错误分析。
文档草垛中的语义针:LLM-as-a-Judge 相似度评分的敏感性测试
PNNL 与华盛顿大学的研究人员提出一套系统化框架,测试五种大语言模型在文档中捕捉细微语义变化的能力,揭示位置偏差、上下文连贯效应及模型特有的评分“指纹”。